
混元 Hy4 preview 总参数 770B、激活参数 49B、上下文长度 1M,定位"为生产力而生"。本文详解其 MoE 架构、软件工程、办公分析与科学研究三大能力跃升,以及编码全球第 6、专家盲测 2.99 分等实测表现,并说明 WorkBuddy 限时免费体验安排。
8 月 28 日,腾讯混元正式发布并开源新一代大语言模型 Hy4 preview。从命名看,preview 意味着它是一次提前亮相的预览版本——早于此前市场预期的 9 月,延续了自 Hy3 preview 以来约两个月一次的大版本迭代节奏。
先看核心规格:
这组数字的关键不在"大",而在"大而不笨"。770B 的总参数提供了足够的能力储备,而 49B 的激活参数让实际推理不必为全部参数买单——这正是 MoE 稀疏激活设计的价值:用更低的推理成本,调用更大的能力池。1M 的上下文则让整本手册、整套代码库、成堆的论文可以一次性喂进模型,不必反复切分。
相比前代 Hy3(总参数 295B、激活参数 21B、上下文 256K),Hy4 preview 在模型尺寸、上下文长度和数据规模上都有显著扩展。这种扩展的直接结果,是模型在真实生产力任务上的能力跃升。
Hy4 preview 的定位是"为生产力而生"。它的能力不是靠纸面跑分堆出来的,而是通过与腾讯内部软件工程、游戏、金融、安全等领域顶尖专家的高质量数据共建,在与 WorkBuddy 等产品的深度协同(Co-Design)中打磨出来的。
这意味着模型的训练数据直接来自真实的业务场景:工程师的实际开发流程、游戏开发者的原型搭建、金融分析师的数据处理、安全专家的研判逻辑。模型学到的不是抽象的"答题技巧",而是真实工作中如何理解需求、规划步骤、调试验证、交付结果。
一个能说明这一点的细节是:Hy4 preview 在自身研发的全链路中就发挥了价值——它首次参与了训练方法、数据策略、评估体系和底层算子的自动优化。模型提出方案、运行实验、根据结果继续迭代,实验产生的代码、日志和反馈进入下一轮探索,形成了初步的递归自我改进闭环。连训练自己的方法都能参与优化,说明它在复杂任务上的自主能力已经走到了一个新的台阶。
在三大生产力场景中,软件工程是 Hy4 preview 提升最直观的一个。
官方披露,Hy4 preview 在软件工程场景下增强了长程开发任务的理解、规划、调试与验证能力,并进一步提升了前端开发的视觉审美和交互质量。具体表现为:
编码能力的提升有明确的榜单佐证。在 CodeArena WebDev 全球排行榜上,Hy4 preview 跃升至第 6 位,而上一代 Hy3 仅排名第 28 位——这是一次跨档位的进步。在 Terminal-Bench 2.1 上达到 85.4(Hy3 为 70.8),DeepSWE 软件工程基准上达到 64.3(Hy3 为 28.0),后者较前代提升超过一倍。
对 WorkBuddy 用户来说,这种能力提升的直接感受是:从"说清需求"到"跑出一个能用的结果",中间需要来回解释和手动修补的环节明显减少。
办公分析和科学研究是另外两个重点突破的生产力场景。
办公分析场景下,Hy4 preview 显著提升了复杂办公环境理解和金融分析能力,着重优化了数据分析、跨文件协作,能够完成从信息处理到文档、表格与演示文稿交付的完整流程。也就是说,模型不只是"读懂"数据,而是能把分析结果直接落成一份可交付的表格、报告或 PPT。
科学研究场景下,模型显著提升了复杂科研问题的理解、推理与求解能力,在 AI 研发、分子动力学模拟、凝聚态物理、基础数学等各类场景中均有长足进步。1M 的超长上下文在这里尤其关键——它让模型可以综合大量网页、PDF、论文与数据材料,完成行业研究、科研分析与资料整理。
这两个场景的共同点是"输入海量、输出结构化"。Hy4 preview 的价值在于把"读得多"和"写得成"打通:既能吞下百万 token 的原始材料,又能把它们组织成可直接使用的交付物。
能力到底处于什么水平?一组来自人工盲测的数据给出了参考。
在一项由 163 名专家参与的 203 个任务盲测中,Hy4 preview 的平均得分为 2.99 分(满分 4 分),略高于 GLM-5.3 的 2.92 分和 Kimi K3 的 2.94 分。这是一项贴近真实工程任务的横向评测,三款模型处于同一梯队,Hy4 preview 在其中略占优势。
需要注意的是,官方也坦诚指出 Hy4 preview 目前仍存在的已知问题:复杂任务中的长思考倾向与过度自我验证倾向。这说明它仍有继续优化的空间,在部分高难度任务上可能出现"想太多"的情况,需要用户在实际使用中结合任务类型加以引导。
综合来看,Hy4 preview 在编码、办公、科研三大生产力场景上已经稳居开源模型第一梯队,尤其在软件工程这类长程任务上的进步最为突出。
Hy4 preview 已在 WorkBuddy 国内版首发接入,并同步开启限时免费体验,截止时间为 2026 年 9 月 10 日 23:59。用户在客户端对话框右上角的模型选择菜单中即可切换到 Hy4 preview,无需额外配置。
免费期内有两点需要留意:
如果在使用中遇到排队(上线初期调用量激增时可能出现),可以切换到限免延长至 9 月 30 日的 Hy3 继续,或把非紧急任务错峰到晚间 23:00 至次日 8:00 执行。
从 8 月 28 日到 9 月 10 日这两周,是零成本体验这款 770B 旗舰的窗口期。对经常用 WorkBuddy 做复杂推理、长程开发、办公分析的用户,不妨趁免费期把它的实际表现跑一遍。
想了解更多关于 WorkBuddy 的功能详情与最新活动,欢迎访问 腾讯云 WorkBuddy 活动页 。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。