来源:市场资讯
(来源:机器学习算法那些事)
DEEP ANALYSIS
当近半数组梯度在互相打架
GUPO 给 GRPO 补上「可靠性」这一课
一项实证研究给出量化证据:GRPO 训练中 46.5% 的组梯度方向互相冲突,而冲突正是「越练越差」的信号
撰文 · 2026年8月24日 | 阅读约10分钟
自 DeepSeek-R1 把强化学习带进推理模型的后训练以来,GRPO(Group Relative Policy Optimization)几乎成了这一赛道的默认选项:它用组内相对优势做标准化,省去了 PPO 里笨重的 critic 模型,训练开销大幅下降。从开源复现到商业后训练管线,GRPO 已经渗透到几乎所有推理模型的训练配方里。
但一个被大多数人忽略的细节,正在悄悄侵蚀它的上限。2026 年 8 月 18 日,Peizheng Guo 等 7 位研究者提交的论文《GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models》给出了一组扎眼的数字:在同一 mini-batch 内,实测 563 对组梯度中有 262 对(46.5%)余弦相似度为负——也就是说,将近一半的时候,不同查询想让模型更新的方向是相反的。而标准 GRPO 的做法,是把这些互相打架的梯度直接平均。
更关键的是,论文证明这种冲突并非无害噪声:高冲突 mini-batch 的验证 ΔNLL 中位数显著更低,甚至出现「负更新」——模型不是没学到,而是越练越差。GUPO 的解法也很克制:不动奖励、不动采样,只在聚合这一层把「确定性平均」换成「不确定性加权」。
论文速览
论文
GUPO: Gradient Uncertainty-aware Policy Optimization for Post-Training Large Language Models(arXiv:2608.17411,2026-08-18)
作者
Peizheng Guo、Jianqi Zhang、Xingyu Zhang、Yun Fan、Jiahuan Zhou、Changwen Zheng、Wenwen Qiang(共 7 人)
核心发现
563 对组梯度中 46.5% 余弦相似度为负;高冲突 mini-batch 对应更差甚至为负的验证更新
方法
贝叶斯建模组梯度分布 → Dirichlet 证据推导不确定性 → 不确定性感知加权聚合
实验规模
3 款模型(1.5B/1.5B/7B)× 6 个数学推理基准,全面超越 6 个近期基线
一句话
GRPO 把所有组梯度一视同仁地平均,GUPO 教它先问一句「这条梯度可信吗」
一、GRPO 的数学便利,埋下了一个统计隐患
要理解这次发现为何重要,得先回到 GRPO 的核心机制。在 PPO 时代,策略梯度需要一个 critic 网络来估计每个状态的价值基线;而 GRPO 的做法是:对同一个查询采样一组回答,用组内奖励的相对排名做标准化——高于组均值的回答被强化,低于组均值的被抑制。这个设计极其优雅,critic 没了,内存省了,实现简单了,也因此成为 DeepSeek-R1 之后推理后训练的事实标准。
但便利的另一面是一个隐含假设:同一 mini-batch 里,不同查询各自诱导出的组梯度(group gradient)大致指向同一个方向。只有这样,「直接平均」才是合理的聚合方式。标准 GRPO 把每条组梯度都视为确定性的贡献,权重一律相同——它从不追问一个问题:这条梯度,可靠吗?
直觉上这个假设就值得怀疑。mini-batch 里的查询难度各异:有的题模型几乎全对,组内奖励无区分度;有的题全错,梯度信息混乱;有的题梯度干净清晰。把「噪声很大的梯度」和「信号清晰的梯度」等权平均,信号自然被稀释。GUPO 团队做的事,是把这个直觉变成可测量的实证。
二、46.5%:一次对训练动态的「体检」
研究者在 GRPO 后训练过程中,对 mini-batch 内所有组梯度两两计算余弦相似度,共得到 563 对组梯度。结果令人不安:其中 262 对(46.5%)余弦相似度为负。将近一半的梯度对,指向的是相反的更新方向。
组梯度对总数
563
同一 mini-batch 内两两配对
余弦相似度为负
46.5%
262 对梯度方向互相冲突
高冲突 mini-batch 的验证 ΔNLL 中位数更低,甚至出现负值 —— 冲突不是噪声,是退化的前兆
冲突本身还不是最糟的。真正致命的关联是:研究者发现组梯度冲突程度与策略更新质量负相关。高冲突的 mini-batch,其验证集上的 ΔNLL(负对数似然变化)中位数明显更低,部分甚至落入负值区间——意味着经过这一步更新,模型在验证集上反而变差了。训练曲线上那些无法解释的抖动和回退,此刻有了具体的统计学解释。
值得强调的是,这类问题在以往文献中大多停留在现象观察层面,GUPO 的贡献在于给出了一条清晰的因果链条:冲突的梯度 → 等权平均互相抵消甚至反转 → 更新方向失真 → 验证性能下降。这为「为什么 GRPO 有时训练不稳定」提供了第一个量化证据链。
三、GUPO 的三步:从确定向量到不确定分布
GUPO 的核心思想可以用一句话概括:不再把组梯度当作一个确定的向量,而是当作一个带不确定性的随机变量,然后让「更可靠的梯度」在聚合时说更大的话。整个方法分三步实现,全部发生在聚合层,不触碰 GRPO 的奖励计算和采样逻辑。
方法三步拆解
01贝叶斯后验建模 —— 直接对 LLM 全部参数做后验估计不现实,GUPO 聚焦策略模型可训练的末层参数 Φ,用高斯近似建立后验 q(Φ|D)=N(Φ₀, Ĥ⁻¹),其中 Ĥ 用经验 Fisher 信息的对角近似得到
02组梯度分布估计 —— 从参数后验中蒙特卡洛采样 M 个参数样本,分别计算组梯度,得到每条组梯度的均值 μ 和逐元素方差 σ²,即梯度的概率分布
03Dirichlet 证据与加权聚合 —— 把梯度精度 λ=1/σ² 映射为证据 e=λˢ,借鉴主观逻辑建立 Dirichlet 浓度参数,推导出组级不确定性 u;聚合权重 ω=(1−u)/Σ(1−u),让低不确定性的组梯度获得更大贡献
第三步里有一个值得玩味的工程细节。GUPO 没有激进地用新权重完全替换原始平均,而是做了一个低侵略性调和:最终权重为 ω̃=(1−η)/B+ηω,其中 η 取 0.1。也就是说,90% 的成分仍是均匀平均,只有 10% 的幅度按可靠性重新分配。这保留了 GRPO 原有的聚合结构,把方法风险压到最低——这种克制,是论文实验能全面稳定涨点的隐性原因之一。
关键洞察
诊断先于治疗 GUPO 的价值排序值得注意:46.5% 冲突率的实证测量本身,比修复方法更重要——它第一次让「GRPO 训练不稳定」从经验感受变成了可监测的指标。
修复发生在聚合层 不改奖励、不改采样、不改网络结构,只在梯度合并这一步引入可靠性加权——这意味着它可以近乎零成本地叠加到任何现有 GRPO 管线上。
四、实验:三个规模、六个基准的全面领先
团队在三款基础模型上验证:DeepScaleR-1.5B-Preview、DeepSeek-R1-Distill-Qwen-1.5B 和 DeepSeek-R1-Distill-Qwen-7B,覆盖 GSM8K、MATH500、AIME 等六个数学推理基准。结果是一边倒的稳定提升,平均 Pass@1 增益在 +2.7 到 +3.0 之间,且规模越大基线越强,增益依然保持。
基础模型
GRPO 平均 Pass@1
GUPO 平均 Pass@1
DeepScaleR-1.5B-Preview60.763.4(+2.7)R1-Distill-Qwen-1.5B52.455.4(+3.0)R1-Distill-Qwen-7B69.671.4(+1.8)
单项基准上,DeepScaleR-1.5B 在 AIME 2024 上提升 +4.2,是最大的单项增益。横向对比方面,GUPO 全面压过近期一批 GRPO 改进工作,包括 Length Penalty、ReST-MCTS、GVPO、Dr.GRPO、GCPO 和 MRT。消融研究进一步确认了两个超参数的鲁棒性:证据敏感度 s 与调和系数 η 在合理区间内波动不大,且性能增益主要来自高冲突 mini-batch——这反向印证了「冲突是问题根源」的诊断。
五、启示与边界:不是银弹,是一面镜子
对于做后训练的团队,这篇论文的价值有两个层次。第一层是直接的:一个低侵入、可叠加的聚合层改进,几乎可以无损并入现有 GRPO 管线换取稳定涨幅。第二层更重要:论文提供了两个此前缺席的观测指标——组梯度冲突率与验证 ΔNLL。把这两个数和 benchmark 分数一起放进训练监控面板,「训练在不在健康区间」第一次有了量化答案。
放在更大的图景里,GUPO 与近期一系列工作指向同一个判断:GRPO 这一代算法的下一个优化空间,不在更大的奖励模型或更多的采样,而在训练信号本身的质量工程。梯度冲突、优势反转、信用误分配——这些统计层面的病灶,正在成为后训练研究的新前线。对主攻小模型后训练的团队而言,这类「训练动力学体检 + 精准微创修复」的方法论,性价比可能远高于堆数据。
需要留意的局限
01计算开销 —— 每个组需要采样 M 个参数样本估计梯度分布,末层聚焦虽已压缩成本,仍比标准 GRPO 多一截前向计算
02基准范围 —— 实验限于数学推理任务,在代码、通用对话、事实性与安全约束等后训练目标上的泛化性尚待验证
03建模假设依赖 —— 对角 Fisher 近似与 Dirichlet 映射的假设在极端梯度分布下的稳健性,论文未充分讨论
04架构泛化 —— 三个模型均为 Qwen 系或其衍生,MoE 架构与其他模型家族上的表现仍是空白
结语:后训练的下一站,是学会「不信」
GUPO 讲的其实是一个朴素的故事:当一半的信号在互相矛盾时,无条件相信每一个信号的平均值,本身就是一种偏见。它教给 GRPO 的第一课不是更聪明的奖励,而是最基本的怀疑精神——先问可信度,再做平均。
对行业而言,这篇论文大概率会被记住的不是 +2.7 的涨幅,而是那个 46.5%。它把「GRPO 训练不稳定」从一个工程师之间的抱怨,变成了一个可测量、可监控、可修复的具体问题。当一个领域开始给训练过程做「体检指标」时,说明它正在从炼丹术走向工程学——而这,正是后训练走向成熟的必经之路。
核心判断
短期 冲突率与验证 ΔNLL 应成为 GRPO 训练监控的标准面板指标,与 benchmark 分数并列汇报。
中期 聚合层加权这类「零侵入」改进,是小模型后训练团队性价比最高的一类增量优化。
长期 训练信号质量工程(梯度冲突、优势反转、信用分配)正在成为后训练研究的新前线——奖励设计之后,这里是下一个价值洼地。
热门跟贴