
今天,我们要深入探讨一个在AI领域,尤其是大语言模型(LLM)训练中,既关键又令人头痛的问题:强化学习(RL)的稳定性。
如果你关注AI的进展,一定对RLHF(人类反馈强化学习)或RLAIF(AI反馈强化学习)这些名词不陌生。它们是当前提升大模型(如GPT-o3、Claude 4、DeepSeek以及我们今天的主角Qwen系列)在复杂推理、数学、编程等高级能力上的核心技术。可以说,谁掌握了高效的RL,谁就掌握了通往更强AI的钥匙。
然而,这把钥匙并不好用。在实践中,大规模RL训练是出了名的“脾气暴躁”。工程师们常常面临一个噩梦般的场景:投入海量的计算资源,训练了数天甚至数周后,模型的性能突然“断崖式下跌”,一切努力付诸东流。这种现象被称为“模型崩溃”,是阻碍我们进一步探索AI能力边界的巨大瓶颈。

长久以来,业界普遍认为这是大规模训练中难以避免的“玄学”问题。但来自阿里巴巴Qwen团队的这篇最新论文《Group Sequence Policy Optimization》却给出了一个截然不同的答案:这并非玄学,而是一个源于现有主流算法的根本性理论缺陷。
更重要的是,他们不仅指出了问题所在,还提出了一套名为GSPO(Group Sequence Policy Optimization)的全新算法,从根源上解决了这一顽疾。这篇论文不仅是Qwen3模型取得卓越性能的幕后功臣,更可能为整个大模型RL领域带来一次范式转移。
接下来,就让我们一起抽丝剥茧,看看GSPO是如何做到的。
要理解GSPO的创新,我们必须先回到问题的原点,看看当前主流的RL算法,如PPO(Proximal Policy Optimization)及其变体GRPO(Group Relative Policy Optimization),到底错在了哪里。
想象一个场景:我们想教一个AI学生写一篇关于宇宙的千字长文。

GRPO等算法的问题就出在学习与更新这一步。它们的核心机制是重要性采样,这是一种在统计学中修正分布偏差的方法。通俗地说,就是AI学生在更新时需要思考:“对于我写的每一个词,新的写作思路和旧的写作思路有多大差别?”这个差别,就是重要性权重。
GRPO的做法是,它会把80分这个整体奖励,试图分配给文章中的每一个词。它会逐字分析:“‘浩瀚’这个词用得不错,应该多给点奖励;‘然后’这个词用得一般,奖励就少点。”
听起来似乎合理,但这里存在一个致命的理论缺陷。奖励是针对“宇宙”这篇文章这个完整序列给出的,而GRPO却试图在单个词(Token)这个层级上进行归因和校正。这就像一个团队项目拿了年度大奖,老板却不去分析成功的项目管理和团队协作,反而拿着放大镜去研究每个成员每分钟的工作效率,并以此作为奖励依据。

这种“张冠李戴”式的操作会带来灾难性后果:
总而言之,GRPO的根本问题在于:优化的基本单位(词)与奖励的基本单位(文章)不匹配。这导致它在理论上就是“病态的(ill-posed)”,训练过程中的不稳定性是其与生俱来的缺陷。
理解了GRPO的困境,GSPO的解决方案就显得格外优雅和深刻。
GSPO的核心思想异常简洁:让优化的单位与奖励的单位保持一致。
既然奖励是给整篇文章的,那么我们也应该从整篇文章的层面来评估新旧策略的差异。GSPO不再问“这个词写得怎么样?”,而是问一个更宏观、更本质的问题:
“以我新的写作水平,写出这篇一模一样的文章的整体可能性,和过去相比,变化了多少?”
这个变化,就是GSPO所使用的、基于整个序列(Sequence)的重要性比例。

让我们深入其技术细节,看看GSPO是如何将这一思想转化为严谨的数学算法的。
1. 核心目标函数
GSPO的优化目标函数如下(见论文公式(6)):

这个公式看起来复杂,但我们可以把它拆解成几个通俗易懂的部分:

这部分和之前一样。针对一个主题(查询),我们让当前的AI学生(旧策略)写出 G 篇文章(响应)。

这个公式的本质就是计算新策略生成这篇文章的总概率与旧策略生成这篇文章的总概率之比。为了防止长文章的概率连乘导致数值过小,这里巧妙地使用了对数和平均,在对数空间计算平均变化,再通过 exp 转换回来。这种“长度归一化”操作,极大地增强了算法的稳定性和鲁棒性。
clip):这是PPO系列算法的经典操作,用于防止模型更新步子迈得太大。GSPO将其应用在序列层面。如果新策略对某篇文章的看法和旧策略差异过大,就将其限制在边界上。这意味着,对于那些新策略“过于自信”或“过于否定”的样本,我们会用一种更保守的态度来学习,从而保证了训练的稳定。
2. 梯度流的对比
如果我们观察最终模型参数更新的梯度,就能更清晰地看到GSPO和GRPO的根本区别。

可以看到,对每个词 y_{i,t} 的梯度调整,都乘以了它自己独立的、不稳定的词级别重要性权重。

这里,构成整篇文章的所有词的梯度,被一个统一的、稳定的序列级别权重所调节。
这个数学上的差异,完美地对应了我们之前的比喻:GRPO是一位在细节上喋喋不休、指令混乱的老师,而GSPO则是一位高屋建瓴、指令清晰的老师。前者让学生无所适从,后者则能引导学生稳步前进。
理论上的优雅固然重要,但算法的真正价值还需要通过严谨的实验来验证。Qwen团队在一系列基准测试上,将GSPO与精调后的GRPO进行了直接对比。实验基于Qwen3-30B-A3B-Base模型,这是一个强大的MoE模型,恰好是考验RL算法稳定性的“试金石”。
结果1:碾压式的稳定性与效率 (图1)

上图是论文中的核心实验结果。横轴是训练所消耗的计算资源,纵轴是模型的性能得分(包括训练奖励和在数学、代码等多个基准上的表现)。
结论一目了然:在同等的计算资源下,GSPO不仅训练过程更稳定,而且能达到远超GRPO的性能高度。
结果2:一个反直觉的发现——裁剪得越多,效果反而越好 (图2)

这个发现尤其深刻。上图比较了两种算法在训练中“裁剪”掉的样本比例。
这完全颠覆了直觉!通常我们会认为,裁剪掉的样本越多,意味着浪费的数据越多,学习效率应该越低。但结果恰恰相反。
这揭示了一个本质问题:GRPO的词级别信号是如此充满噪声,以至于算法自身都无法有效分辨出哪些是“离群的坏样本”。它很少裁剪,不是因为样本质量高,而是因为它已经“好坏不分”。
而GSPO的序列级别信号非常清晰,它能自信地识别出那些与当前策略“三观不合”的整个序列,并果断地将其裁剪掉。虽然丢弃了15%的样本,但剩下的85%都是高质量、高信噪比的学习材料,从而带来了更高的训练效率。这证明了学习信号的“质”远比“量”更重要。
结果3:彻底攻克MoE训练难题 (图1 vs 图3)

上图展示了GRPO在没有“路由重放”这个补丁时训练MoE模型的灾难性后果(橙色曲线迅速崩溃)。而图1已经证明,GSPO在训练同一个MoE模型时,完全不需要任何额外技巧,就能保持完美的稳定性。
这雄辩地证明,GSPO并非只是一个“更好的补丁”,而是从根本上解决了MoE模型中专家路由变化所带来的不稳定性。因为它关注的是宏观的序列似然,而这种宏观属性对于底层的专家选择变化具有天然的鲁棒性。这不仅大大简化了训练流程,节省了资源,还让MoE模型得以发挥其全部潜力。
GSPO的提出,不仅仅是发布了一个新算法,它为整个大模型RL领域带来了几点重要的启示,并指明了未来的方向。
首先,GSPO为更大规模的RL训练铺平了道路。稳定性的问题一直是制约RL规模化的“阿喀琉斯之踵”。通过提供一个理论坚实、实践可靠的算法基石,GSPO让我们有信心向着更大、更复杂的模型和任务进行探索,而不必过分担心训练过程中的意外崩溃。
其次,它展示了“回归第一性原理”的价值。面对复杂的工程问题,有时最有效的解决方案并非叠加更多的技巧和补丁,而是重新审视问题的根源,从最基本的理论出发进行修正。GSPO对重要性采样原则的正确应用,就是一个绝佳的范例。
总而言之,Qwen团队的GSPO是一项优雅、深刻且极具影响力的工作。它通过一次“返璞归真”的理论重构,解决了长期困扰大规模RL训练的核心痛点,为我们通往更强大、更智能的AI系统的道路,扫清了一个关键的障碍。
参考文献
论文名称: Group Sequence Policy Optimization Reasoning via Reinforcement Learning
第一作者: 阿里Qwen
论文链接: https://arxiv.org/abs/2507.18071
发表日期: 2025年7月24日
GitHub:无
你好,我是唐国梁Tommy,专注于分享AI前沿技术。
#Qwen #阿里通义千问 #AI大模型 #强化学习 #LLM #DeepSeek #ChatGPT #唐国梁Tommy #AI前沿技术 #多模态大模型 #人工智能 #计算机技术