7 月 27 日 Kimi K3 的完整权重正式开放,2.8 万亿参数、百万 token 上下文,加上此前美团 LongCat-2.0 开源并同步放出国产卡推理代码,万亿级模型第一次真正摆到了普通团队面前。但我的感受是,门槛已经从“能不能拿到模型”变成“能不能付得起推理和编排的成本”——权重是免费的,显存和每一次长上下文调用并不免费。想请教已经落地过的朋友:中小团队更应该继续用托管 API 并按任务难度做大小模型分流,还是值得自建国产算力集群去跑量化版本?大家判断这条分界线时,通常会看哪几个指标?
相似问题