
2026 年 8 月 28 日,腾讯混元发布并开源 Hy4 preview,总参数 770B、激活参数 49B、上下文长度达到 1M,采用 Apache 2.0 协议。同期在云上可直接调用的同档模型还有 GLM-5.3-Flash、Kimi K3 和 DeepSeek-V4-Pro 0813 正式版。四款模型的上下文窗口都做到了 1M 量级,价格却相差数倍,能力标注也各有侧重。本文不给出一个脱离任务的"谁更强"排名,而是把调用参数、上下文额度、工程化能力和价格摆进同一组维度,再按四类典型任务给出倾向性建议。
选型第一步不是看跑分,而是确认这四款模型在接入层是否真的可比。
模型 | 调用参数 | 上下文窗口 | 最大输入 | 最大输出 |
|---|---|---|---|---|
Hy4 preview |
| 1M | 960k | 64k |
GLM-5.3-Flash |
| 1M | 1M | 128k |
Kimi K3 |
| 1M | 1M | 1M |
DeepSeek-V4-Pro 0813 正式版 |
| 1M | 1M | 384k |
四款模型的上下文窗口都是 1M,但"窗口"不等于"能灌满"。Hy4 preview 的最大输入是 960k,实际单次请求能塞进去的内容略低于窗口名义值;最大输出 64k,是四款里最保守的一档。
这一栏直接决定架构设计。如果场景是"一次喂进整套代码库,再让它产出一份长报告",Kimi K3 的 1M 最大输出和 DeepSeek-V4-Pro 的 384k 最大输出会更从容。如果场景是"大量输入、结构化短输出",比如日志归因、字段抽取、分类打标,Hy4 preview 的 960k 输入配 64k 输出是够用且成本更可控的组合。
输出上限还决定流式返回的时长预期。把 64k 当成硬约束去设计前端交互和超时策略,比上线后再返工要省事得多。
四款模型都支持深度思考、结构化输出、Function Calling 和 Cache 缓存,这四项已经算是同档模型的标配。差异主要在两处。
一处是思考方式。Hy4 preview 的深度思考标注为"保留式思考",其余三款未做进一步区分标注。在需要模型保留中间推理过程的调试场景中,这个差异会影响你如何设计日志采集。
另一处是多模态。GLM-5.3-Flash 标注支持多模态理解,Kimi K3 标注支持图片与视频理解;Hy4 preview 位于语言模型清单中,未标注多模态输入能力。所以涉及截图理解、图表解析、视频摘要这类任务,前两款是更直接的选择,不必指望用语言模型加 OCR 拼出来。
Cache 缓存这一项在账单上最容易被低估。它的作用是复用历史请求中的上下文计算结果,减少重复计算开销,从而提升响应速度并降低调用成本。对于"长系统提示词 + 多轮追问"的形态,命中率往往能维持在较高水平,此时真正的计价主体是缓存命中价而不是输入价。
下表为广州地域在线推理的按量价格,单位为元/百万 tokens。
模型 | 推理输入 | 推理输出 | 缓存命中 |
|---|---|---|---|
Hy4 preview | 6 | 18 | 0.3 |
GLM-5.3-Flash | 0.8 | 2.8 | 0.23 |
Kimi K3 | 20 | 100 | 2 |
DeepSeek-V4-Pro 0813 原厂直供(空闲时段) | 4.5 | 13.5 | 0.15 |
DeepSeek-V4-Pro 0813 原厂直供(高峰时段) | 9 | 27 | 0.3 |
按一次任务消耗 100 万输入 tokens、20 万输出 tokens、且未命中缓存来粗算:Hy4 preview 约 9.6 元,GLM-5.3-Flash 约 1.36 元,Kimi K3 约 40 元,DeepSeek-V4-Pro 在空闲时段约 7.2 元、高峰时段约 14.4 元。差距主要来自输出单价,而不是输入单价——所以压缩输出长度通常比压缩输入更省钱。
需要提醒的是,上表是目录价,实际账单还要看厂商的限时优惠与时段计费规则:
Hy4 preview 在按量计费路径上按目录价结算,没有折扣;但通过 Token Plan 个人版订阅套餐调用时可享积分抵扣系数限时优惠:2026 年 9 月 1 日 00:00:00 至 9 月 30 日 23:59:59(北京时间)期间,输入、输出、缓存命中的抵扣系数由 120、360、6 分别下调至 100、200、4,其中输出档折让幅度最大。该优惠对所有 Token Plan 个人版用户自动生效,活动结束后恢复标准系数。需注意的是,通用 Token Plan 的模型列表中已标注 Hy4 preview 当前资源负载较高,高峰时段可能触发限频。
DeepSeek-V4-Pro 0813 正式版采用峰谷计费:高峰时段为周一至周日 9:00~12:00、14:00~18:00,其余为空闲时段;时段判定以平台服务端接收到请求的时间为准,请求的处理时长和返回时间不影响判定。这意味着离线批处理任务错峰到夜间或凌晨就能拿到空闲价,而在线服务基本避不开高峰。
GLM-5.3-Flash 则在限时折扣期内:自说明发布之日起至 2026 年 9 月 10 日 23:59:59(北京时间)按目录价格的 50% 结算,跨越优惠期的调用按请求发起时间计算。
长文档与代码库整体分析。 四款在输入侧都够用,分水岭在输出侧。需要模型一次性吐出长篇分析报告时,Kimi K3 与 DeepSeek-V4-Pro 的输出上限更宽;如果产出物是结构化结论、要点列表或 JSON,Hy4 preview 的 64k 输出通常不会构成瓶颈,而输入侧 960k 与 1M 的差距在真实业务里几乎感知不到。
Agent 与工具调用。 四款都支持 Function Calling 与结构化输出,地基一致。真正的变量是多轮长任务下的缓存命中率:Hy4 preview 的输入价 6 元、缓存命中价 0.3 元,DeepSeek-V4-Pro 空闲档为 4.5 元与 0.15 元。把稳定的系统提示词和工具定义放在前缀里,让后续轮次尽可能命中缓存,比换模型更能压住账单。
高并发且成本敏感。 GLM-5.3-Flash 的目录价在四款中最低,折扣期内优势进一步扩大,适合意图识别、文本分类、摘要抽取这类高频短任务。需要注意的是它的最大输出为 128k,长输出场景要提前评估。
多模态输入。 涉及图片或视频理解时,GLM-5.3-Flash 与 Kimi K3 是更直接的选择;Hy4 preview 未标注多模态输入能力,不建议用于这类场景。
四款模型都可以在大模型服务平台 TokenHub 上调用,这带来一个被低估的好处:切换模型的成本被压缩到只改一个 model 参数,鉴权、计费、监控和账单体系保持统一,不必为每个模型单独接一套供应商。平台同时提供按量调用、保障型资源和专属部署三种服务模式,业务验证期用按量、稳定期转保障型资源或专属部署,是常见路径。新用户还可以零门槛领取 100 万 tokens 的免费额度,用真实流量样本跑一轮对照,比看参数表更可靠。
建议在正式切换前做一件事:用线上的真实请求采样,记录输入、输出、缓存命中三段的实际 token 分布,再套回上表的单价。多数团队算完会发现,决定成本的不是选了哪款模型,而是输出长度和缓存命中率。
无论最终选哪一款,先用真实流量跑一轮成本核算,再决定切换节奏。
立即了解大模型服务平台 TokenHub:https://cloud.tencent.com/product/tokenhub
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。