
7 月 27 日,月之暗面把 Kimi K3 的完整权重开放给了开发者。 2.8 万亿参数、百万 token 上下文,是目前公开权重里规模最大的一档;再往前一周,美团的 LongCat-2.0 也把 1.6T 模型连同国产卡推理代码一起开源。两件事叠在一起,传递的信号很清楚:拿到一个万亿参数的前沿模型,已经不再是门槛。
一、免费的是权重,不免费的是显存
2.8 万亿参数即使用 FP8 存放,光权重就要占掉 TB 级的显存空间,单机根本放不下,必须做多机多卡的专家并行与 KV Cache 分层。百万 token 上下文又把成本推到另一个量级:KV Cache 会随上下文线性增长,一个长会话占掉的显存,可能比模型激活部分还多。所以“我下载了权重”和“我能稳定地对外提供服务”之间,隔着一整套推理工程。
二、真正被开源的是推理经验
这一轮开源里更值得注意的,其实是 LongCat-2.0 同步放出的国产卡推理代码。过去大厂开源模型,通常只给权重和一份能跑通的脚本,适配、量化、调度都要业务方自己摸。现在把万亿参数模型在国产算力集群上跑通的工程细节也一并放出来,等于把最难复现的那部分经验开源了。对多数团队来说,这比榜单上多几个百分点更有价值。
三、模型越强,编排层反而越重要
K3 被强调的能力是长周期软件工程,官方给出的例子是它在 48 小时里基于开源 EDA 工具链独立跑完了一款芯片从架构到验证的流程。任务链路越长,系统对编排层的依赖就越强:任务要能拆解、能中断续跑、能回滚,工具调用要有权限边界,每一步的输入输出要能审计。模型能一口气跑两天,不代表你的系统扁得住两天的失败重试和成本消耗。
四、给中小团队的现实建议
不建议一上来就自建集群跑满血版。更稳的路径是先用托管 API 把业务跑通,摸清任务的难度分布,再按难度分流:简单任务走小模型或量化版本,复杂长链路任务才调用大模型。同时把三件事沉淀成自己的资产:检索与记忆的质量、任务编排与失败恢复、单位任务成本的监控。这些东西不会因为下一个更大的开源模型出现而作废。
结语
从 K3 到 LongCat-2.0,开源正在把“最强模型”变成一种可获得的公共资源。当权重不再稀缺,团队之间的差距就落在推理部署能力、编排工程能力和成本控制能力上。对开发者而言,值得提前投入的也许不是追新模型,而是先把那套能承接任何模型的工程底座搭起来。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。