首页
学习
活动
专区
圈层
工具
发布

GLM-5.3防守反击:编程屠榜、安全能力涌现、订阅全量开放

基于后训练Scaling的GLM-5.3。图片由AI生成

文丨晓静

编辑丨苏扬

8月14日,智谱发布新一代旗舰模型GLM-5.3。新模型与GLM-5.2基座模型完全相同,所有能力提升都来自后训练Scaling,且模型“涌现”出了超出预期的网络安全能力。

在内部自建体感评测中GLM-5.3较GLM-5.2提升50%,并在Terminal Bench 3.0、Agents’ Last Exam(CLI)等公开基准测试中取得开源第一。

更值得关注的是,其在白盒代码审查与漏洞发现等安全任务上的表现,已与Anthropic的Mythos 5持平。

智谱透露,将在发布两周后开放模型权重,在此之前通过分层风险审查等对模型进行加固。与此同时,官方编程工具ZCode、效率工具AutoClaw上线。

此次上线的GLM-5.3,可以看成是针对一大批主打性价比模型的“防守反击”,最具代表性的调整是此前一直限时抢购的Coding Plan,正式全量向用户开放。

01 基座没换,全靠“后训练Scaling”

相比GLM-5.2,GLM-5.3基座模型保持不变,但通过数十倍的长程任务环境、更丰富的环境类型,以及超长的后训练时间,把同一基座的智能上界往上抬了一截。

在多项主流基准测试中,GLM-5.3均位列开源模型之最,编程与智能体能力接近Claude Fable 5,编程体感超过其他国产模型。

衡量模型在真实终端环境完成复杂任务的Terminal-Bench 3.0,得分从4.6提升至28.3;聚焦长程软件工程的DeepSWE v1.1,从46.2提升至66.9;覆盖跨工具协作与长程任务的Agents’ Last Exam,从23.8提升至28.5;在覆盖44种职业的GDPval-AA v2中得分1769。

智谱还披露了自研Z.ai Code Bench的体感评测。

在High档位下,GLM-5.3达到31.4%的准确率,超过Claude Opus 4.8最高档位的29.5%;且每项任务平均输出约5万tokens,而Opus 4.8需要约12万tokens——用更短的执行路径,完成了更准的任务。

上述能力项的提升,都来自于后训练:基于IndexShare、SAO以及持续演进的新一代Slime框架,在与GLM-5.2完全相同的基座上高效推进强化学习。

“可能我们还远未开发出这个基座的智能上界。”智谱在新闻稿中表示。

值得注意的是,目前国产前沿模型也都在押注后训练的逻辑。刚刚上线的DeepSeek V4系列正式版,其基准测试数据相比预览版有了大幅提升,而这一提升同样来自后训练Scaling。

02 “涌现”的安全能力

在任务环境不断扩张的过程中,智谱称GLM-5.3在网络安全领域的表现超出预期。

在智谱看来,安全和编程有共同性,这是除了后训练之外,GLM-5.3安全能力涌现的另一关键。

“安全工作本质上就是约束严格的编程能力。”智谱在新闻稿中强调。

在从白盒源代码识别漏洞的CyberGym中,GLM-5.3得分84.5%,高于GLM-5.2的77.2%,也略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%。

在更考验深度推理的ExploitBench中,GLM-5.3得分54.4%,是GLM-5.2(24.4%)的两倍多,但仍低于Mythos 5的78.0%和GPT-5.6 Sol的76.5%。

考察漏洞利用吞吐量的ExploitGym中,GLM-5.3两小时内完成105项任务、六小时内130项,相对GLM-5.2的29项和39项提升巨大。不过,Mythos 5仍以181项和247项领先。

智谱表示,越接近漏洞利用链前端,GLM-5.3相较前代的提升越明显;越深入完整利用,与Mythos 5等闭源前沿模型的差距越大。这意味着GLM-5.3进步最快的方向,也是需要重点追赶的方向。

03 “追凶neo”与“开源的盾”

根据智谱提供的数据,自GLM-5.2发布以来,智谱联合清华大学、南开大学、奇安信、腾讯玄武、云鼎实验室等多家安全团队开展密集红队测试,累计发现漏洞2436个,其中1097个为中高危,许多漏洞潜伏多年甚至数十年,最早可追溯至约45年前。

这些发现覆盖系统内核、操作系统、浏览器引擎、开源基础组件、互联网应用与协议等269个项目,参考Zerodium、Pwn2Own等全球漏洞赏金市场报价,经济价值达3000万元。相关漏洞已陆续提交CNNVD/CNVD国家漏洞库。

其中,安全团队借助GLM-5.3协助发现并提前化解了多起“本可能发生”的安全事件,其中包括在Cursor代码编辑器中定位到Rust与Electron混合架构的失陷风险等。

2026年7月,一台位于巴西的临时文件服务器进入合作伙伴FOFA旗下Ferret引擎的监测范围,GLM-5.3很快还原出一个名为“Neo”的AI Agent攻击链——它管理着4台服务器、7个域名、6万个邮箱和100多个脚本,已发出18567封钓鱼邮件,目标直指A国会计行业。GLM-5.3辅助研究人员从碎片化线索中还原整条攻击链,帮助Ferret捕获该攻击。

基于这些成果,智谱随GLM-5.3同步启动“开源的盾”计划:对重点开源项目开展持续安全审计、向开源社区免费提供模型额度、在ZCode中内置代码审计功能。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/Ob_2ELw74cLMG_3FI3sJHKgQ0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券