智猩猩AI整理
编辑:没方
昨天,xAI 核心RL研究员张鼎怀宣布,自己已离开 xAI 一段时间了,目前尚未公布下一站。
这次离职值得关注的一个原因是,他做的恰好是当下大模型厂商越来越重视的一块,大规模后训练(scaling posttraining)。
张鼎怀本科就读于北京大学数学科学学院,随后前往 Mila,在图灵奖得主 Yoshua Bengio 团队攻读博士。博士期间,他曾先后在苹果机器学习研究团队(Apple MLR) 和 Meta FAIR团队实习。
毕业后,张鼎怀加入微软新英格兰研究院担任高级研究员,之后转入 xAI。
在 xAI,他主要研究RL 稳定性、RL scaling,以及 Coding RL 的大规模训练。简单来说,就是大模型预训练完成之后,怎么继续通过强化学习,把 Coding、推理和 Agent 能力往上推,而且要保证超大规模后训练能够稳定跑起来。
这也是 Grok 4.5 能力跃升背后值得注意的一条技术线。
在 Grok 4.5 发布时,张鼎怀曾专门提到,团队这次将RL Scaling 推到了新规模,该模型实现了顶级智能体编程表现。在这几个月,他主要负责 RL 稳定性与能力相关的基础算法改进,并持续迭代 RL 基础设施。
而最近 DeepSeek 和智谱的动作,更是把后训练的价值摆到了台前。
今年 7 月,DeepSeek 更新 V4-Flash 时明确表示,V4-Flash-0731 与 Preview 版本保持相同的模型架构和规模,只进行了重新后训练。
结果 Agent 能力却出现明显跃升,Terminal Bench 2.1 达到 82.7,DeepSWE 达到 54.4,DSBench-FullStack 达到 68.7。
智谱最近发布的 GLM-5.3 报告更直接,开篇就强调:“Scaling post-training is all we did for GLM-5.3.”
GLM-5.3 与 GLM-5.2 使用的是同一个 Base Model,没有重新训练更大的基座。
过去一个月,团队主要扩大训练环境、增加任务多样性,并继续扩大后训练计算规模。而 GLM-5.3 在复杂 Coding 和长时程 Agent 任务上继续明显进步,智谱内部 Code Bench 相比 GLM-5.2 提升约 50%。
可以看出,大模型能力竞赛,正在从单纯堆预训练参数和数据,进一步转向大规模后训练。
尤其是 Coding、推理和 Agent 这类能力,模型底座相同,并不意味着能力已经定型。谁能把 RL 跑得更大、更稳、更有效,正在成为下一阶段模型拉开差距的关键。
这也是为什么,像张鼎怀这样长期研究 RL Scaling 和训练稳定性的研究者,正在变得越来越重要。