快速阅读: DeepSeek上线V3.1,采用混合推理架构和UE8M0 FP8参数精度,性能提升成本降低,引发资本市场关注,国产芯片概念股大涨,用户反馈积极,部分功能仍需优化。
DeepSeek V3.1 上线,官方一条留言引爆了整个 AI 圈。新架构、下一代国产芯片,短短不到 20 字的信息引发了广泛热议。经过两天的科普文章阅读,老狐认为,国产 AI 正在走向软硬协同阶段,未来有望大幅减少对英伟达、AMD 等国外算力的依赖。此次更新不仅打破了“性能越高成本越贵”的行业魔咒,还为金融、医疗等高算力应用场景打开了新的想象空间。
资本市场对此反应迅速,DeepSeek 宣布更新后,国产芯片概念股应声大涨,每日互动尾盘直线拉升,收盘大涨 13.62%。有网友调侃说,国产芯片迎来史诗级暴涨,DeepSeek 一句话让周五大盘直接冲上 3800 点。
DeepSeek 官方低调发布了 V3.1 版本,没有大肆宣传。老狐整理了这次更新的核心亮点,最具革命性的创新在于其混合推理架构——Hybrid Reasoning Architecture。该架构同时支持思考模式和非思考模式,用户可以随时切换,既能慢慢分析,也能快速得出结果。
此前,DeepSeek 的产品线分工明确:V3 模型擅长通用对话,R1 模型更侧重深度思考。这种分离式架构虽然各有所长,但用户频繁切换较为不便。如今,V3.1 打破了这一壁垒,将通用对话、复杂推理、专业编程等多种核心功能集成在一个模型中,使使用体验更加灵活高效。
此外,V3.1 的推理效率也大幅提升。官方数据显示,在思考模式下,V3.1 在各项任务中的平均表现与前代顶级 R1-0528 持平,但输出的 token 数量减少了 20% 至 50%。在非思考模式下,输出长度更短,但性能不打折扣。这得益于“思维链压缩”技术,模型在训练阶段学会了生成更简洁高效的推理路径,同时确保答案准确。简单来说,算法变得更聪明了。
为何要这么做?很简单,为了降低成本。过去,虽然思维链能增强模型推理能力,但冗长的中间步骤导致高昂的计算成本和 API 调用费用,难以大规模应用。V3.1 的思维链压缩技术解决了这一问题,将高级 AI 推理能力从学术工具变为可大规模商业化的经济方案。
社区测试显示,DeepSeek V3.1 在 Aider 多语言编程测试中得分超过 Claude 4 Opus,且成本更低。开发者们纷纷刷屏,Hugging Face 上的热度也显著上升。值得注意的是,DeepSeek 宣布 V3.1 采用 UE8M0 FP8 参数精度,并对分词器和 chat template 进行了较大调整,与之前的 V3 版本有明显区别。
关于 UE8M0 FP8,老狐简要科普如下:FP8 是将普通浮点数压缩为 8 位存储,既节省空间又降低算力需求。MXFP8 采用“块缩放”思路,将数据分块,每块使用独立的缩放系数,从而在保留信息的同时进一步节省资源。U、E、M 分别代表“无符号 + 指数 + 尾数”,UE8M0 中所有 8 位都用于表示指数,没有尾数和符号位,使得处理器恢复数据时只需移动指数位,无需复杂乘法,速度快、路径短。这种格式动态范围大,能够同时表示极大和极小的数,不易溢出或被压成零,即在保证 8 位张量精度的同时,将信息损失降至最低。
对于国产新芯片而言,UE8M0 FP8 格式尤为适用。以往大部分国产 AI 芯片仍采用 FP16/INT8,无法原生支持 FP8。新一代芯片如摩尔线程 MUSA 3.1 GPU 和芯原 VIP9000 NPU 开始支持原生 FP8,DeepSeek V3.1 的 UE8M0 格式正好匹配这些硬件。总结来说,UE8M0 FP8 使模型在新一代国产芯片上运行得更省空间、更快、更稳定,同时保持精度,为国产 AI 带来了低成本、高性能的新可能。
更新后,DeepSeek 官网确认了用户的猜测,将 App 和网页端的“深度思考 (R1)”更名为“深度思考”。网友们也玩出了新花样,有人分析新模型生成的小球跳动效果更符合物理定律,还能调节重力、摩擦、旋转速度和弹跳等参数;有人用 V3.1 制作振动编码,现场变身 VJ;还有人让 V3.1 为自己画了一幅自画像,风格独特。
不过,也有部分用户反馈翻译和写作存在问题,需要现场编写 SYSTEM PROMPT,中英文混杂和错词现象偶有出现,略显混乱。感兴趣的读者现在可以上官网自行体验一番。老狐认为,每次 DeepSeek 的更新都令人期待下一次,几乎成为国产 AI 的精神图腾,让我们一起期待 DeepSeek R2 的到来。
(以上内容均由Ai生成)