参数更少、成本更低、跑得更快,还不用依赖英伟达生态——7月31日,DeepSeek偷偷放了个大招,发布V4-Flash正式版。
专家评价:DeepSeek-V4-Flash可能是今年最值得关注的国产大模型。
五大创新突破,一次看完:
一是小参数反超大参数,AI模型的性能天花板,不再只靠堆参数来突破了!
如果你只关注模型的参数规模,你可能会错过DeepSeek-V4-Flash的真正分量——284B总参数、13B激活参数,远小于V4-Pro的1.6万亿。但它在多项基准测试中,跑赢了自家这个旗舰预览版。
最厉害的是它的代码修复基准DeepSWE——得分从7.3暴涨至54.4,涨幅超过640%。终端操作、网络攻防、工具调用分数也大幅领先,综合智能体得分25.2,逼近Claude Opus 4.8。
专家表示,V4-Flash的发布,传递了一个清晰信号:AI的竞争正在从“更大”转向“更聪明”。
过去两年,行业陷入了一场参数规模的军备竞赛——万亿参数、十万亿参数,数字越飙越高。但V4-Flash用284B总参数证明了:参数规模不是唯一标准,架构设计、训练方法、推理效率同样关键。
二是低成本:百万Token也能轻松跑。新版本原生支持100万Token超长上下文,但算力消耗只有前代V3.2的27%,显存占用降至原先的10%。你上传整本小说、几十页合同,它都能完整解析,而且不烧显卡。
三是推理速度又快又省。每层256个专家只激活6个,独创并行策略打破了张量并行单机8卡的限制。API调用成本远低于同级别模型,适用于高并发商业场景。
四是模型训练没改架构,只靠“调教”。正式版没有修改任何底层架构和参数规模,仅通过精细化强化学习和高质量数据重训,实现了工具调用、代码开发能力的跨越式提升。
这证明了一个方向:选对“老师”、用对“教材”,轻量级模型一样能变得很聪明。
五是摆脱了英伟达的生态。这一点至关重要!这是最具战略意义的创新——全部核心算子基于Triton自研,脱离英伟达CUDA生态。国产GPU、通用算力卡无需厂商定制适配即可直接部署。同时兼容OpenAI和Anthropic双API接口,各大云厂商一键接入。
一句话:不再被英伟达“卡脖子”了。
很多人可能会问,这次更新的DeepSeek-V4-Flash和DeepSeek-V4-Pro到底有什么区别?
V4-Pro:旗舰顶配,针对企业级复杂科研、重度开发、超高难度逻辑任务,硬件和调用成本极高,不适合普通人。
V4-Flash:砍掉冗余算力,提速降价,降低硬件门槛,完整保留普通人99%的常用功能。
打个比喻,V4-Pro版本是“专业防弹车”,V4-Flash是“日常用车”——前者解决最难的题,后者服务最多的人。
对普通人意味着什么?
最关键的一点来了:普通消费者如何使用?其实很简单,只是很多人根本没注意到:
打开DeepSeek官网或手机App,有免费账号就能使用DeepSeek-V4-Flash版本,并不收费,在对话框里选择“深度思考”模式即可。
专家表示,这可能是2026年国产大模型最值得记住的产品版本之一。
来源:光明日报
作者: 袁于飞