等了好久说好6月份要发新版的 DeepSeek 终于有消息说,V4 正式版本要发布了,现在已经在生产环境灰度。

我的第一反应是困惑:V4 不是 4 月份就已经上线了吗?一直在用的 DeepSeek-V4-Pro 是假的?
仔细研究了一下才发现,DeepSeek 采取了一种与其他大模型厂商完全不同的发布策略。
其他家有新模型,都是会明确在官方发布版本更新,更换版本号,还会有新闻通告,自媒体跟着更新一波。
DeepSeek 的做法不太相同:悄悄地在后台这里改进一点、那里改进一点,改完先灰度让部分用户用上,收集反馈再继续调优,最后形成一个新版本,才宣布:"好了,现在是正式版了。"
"许多用户以为自己过去两个多月一直在用 V4,其实只是预览版。"
DeepSeek 从 4 月 24 日就让用户调用了 deepseek-v4-pro 和 deepseek-v4-flash,产品界面上从来没标注过"Preview",API 文档也不显眼。
绝大多数用户,包括我在内,都以为自己用的是正式版。
「满血版」是社区对 DeepSeek V4 正式版(GA,General Availability) 的俗称,预计于 2026 年 7 月 15 日全量上线。
与之对应的是 4 月 24 日发布的「预览版」(Preview)。
正式版经过两个多月大规模工程调优、海量数据迭代、并发压力测试,补齐了全部企业级功能,达到稳定商用标准。一句话总结:
「满血版」就是 V4 GA 正式版 — 补上了预览版缺失的推理速度(+60~85%)、Agent 能力(+21% 完成率)、原生多模态(图像/视觉)、企业级工具链和完整开源生态。

上表涵盖了全部 17 个维度的改进细节。以下是其中最值得关注的几个从无到有的变化:
多模态:预览版是纯文本模型,正式版首次原生支持图像推理。
DeepThink 引擎可以在同一个思考流程中分析图片、解读截图、处理混合文档,这是 DeepSeek 产品线从纯文本到多模态的质变。
企业级功能:预览版只能对话,正式版可生产部署。
补齐了工具调用(参数准确率提升 40%)、复杂多轮自主 Agent(完成率提升 21%)、百万字长文档深度分析、标准化 JSON 稳定输出等能力。
开源程度:预览版只放了部分权重,正式版完整开源。
包括全部权重文件、训练脚本和推理代码,开发者可本地完整部署 1.6T 参数模型,无需依赖任何闭源组件。
正式版将 DSpark 半自回归推测解码框架作为标配部署到全线模型。DSpark 由北大联合开源,基于 MIT 协议,实测让目标模型平均有效生成长度较 EAGLE3 提升 30.9%。
更详细见DeepSeek 太快了!
这是 DeepSeek 产品线首次原生支持多模态推理。
DeepThink 引擎可以在同一个思考流程中分析图片、解读截图、推理视觉信息:
预览版是纯文本模型,多模态是正式版从无到有的核心升级。
2026 年 7 月 18 日,开发者 Pankaj Kumar 在 X 上率先发布 V4 GA 灰度体验报告(18.3K Views)。
他预测正式版很可能明天(7 月 19 日)发布,最迟不过这几天,并透露灰度测试已经在部分用户中开始。
原帖对性能的评价:
"整体达到 Opus 4.8 水平,编码能力接近 GPT-5.6 Sol,但完成同一任务需要比 Fable 5 更多的迭代轮数。 Agent 能力大幅增强,3D 和 SVG 生成显著变好。从当前生态位来看,V4 大概率打不过刚发布的 Kimi K3,但价格会显著更低。 如果 DeepSeek 能以这个价格交付这个水平的性能,我们可能又会见证一次 DeepSeek 时刻。"
具体来看,Pankaj Kumar 的评价涵盖了七个维度:
整体能力接近 Opus 4.8 级别,属于当前开源模型的顶尖水平;
编码能力接近 GPT-5.6 Sol,这个成绩对开源模型来说相当惊艳;
但迭代效率是短板,同样一个任务 V4 需要的尝试轮数比 Fable 5 多,说明单次推理质量仍有差距。
Agent 能力和 3D/SVG 生成被特别表扬,称"大幅增强"和"显著变好"。
与刚发布的 Kimi K3 相比,Pankaj 判断 V4 在纯性能上大概率打不过,但价格优势巨大,"如果这个性能配上这个价格,可能又是一次 DeepSeek 时刻"。
博主 AiBattle 在 X 上给出了一个民间检测方法:看思维链(CoT)的第一人称。
打开 DeepSeek 网页端或 App,开「深度思考」或「专家模式」,随便提一个需要推理的问题,然后观察模型的思考过程。
关键在于开头那两三个词。
如果模型说 "I'm" 或 "I'll",恭喜你,大概率已经用上了 V4 GA 满血版。
如果开口还是 "Let me",那很遗憾,你用的还是老版本,要么是 V4 预览版,要么是更早的 V3.2。
原理:V4 GA 版的推理引擎 DeepThink 在训练中将思维链的语言风格从第三人称改成了第一人称,从"让我来做某某事"变成了"我要做某某事"。
这是一个训练层面的系统性差异,比看上下文窗口大小更可靠,因为 V4 预览版也已经是 1M 上下文了,光看这个区分不了 GA 和预览版。
除 AiBattle 验货口诀外,还可以用以下方法交叉验证:


第一,V4 Pro 在 SWE-bench Verified 上距 Claude Opus 4.6 Max 仅差 0.2 个百分点,但价格只有对方的约八分之一。
第二,Flash 版本尤其夸张。
百万输出 token 只要 0.28(平时),如果缓存命中,输入价格低至 0.0028,跟不要钱差不多。
对比 Fable 5 的 $50/百万输出,Flash 的价格不到其百分之一,但 SWE-bench 也有 79.0%,并不是敷衍的缩水版。
第三,DeepSeek 的定位非常清晰:
不追求全项第一,但坚持"Opus 级能力 + 极低价格"的路线。
在 Claude、GPT、Kimi 这些定价数十美元/百万 token 的玩家面前,哪怕是装上了峰谷计价器,V4 依然是那个大杀四方的"价格屠夫"。

参考来源:
你用哪个大模型比较多,DeepSeek 还是 Kimi ?
欢迎评论区留言。
-END-