强化学习训练大模型时,一个尴尬的现象反复出现:题目越难,模型越学不到东西。研究者把这种收益集中在简单题目上的现象,称为LLM强化学习的马太效应——会的越来越会,不会的始终不会。
问题出在梯度为零
打开网易新闻 查看精彩图片
GRPO这类方法依赖组内回答的对比来产生梯度。当一组回答全部错误时,组内没有可对比的差异,梯度为零,这次采样等于白跑。难题上,这种情况出现得格外频繁,训练信号就这样被浪费掉了。
针对这一点,研究者提出了Never Give Up方法。思路并不复杂:当GRPO组内所有回答都错误时,以约0.9的概率继续采样,直到找到能产生非零梯度的批次。
不放弃那一次采样
换句话说,模型在难题上全错时不再直接跳过,而是多试几次。研究显示,这一方法有效,能把原本被丢弃的训练机会重新利用起来。
研究者还借助异步RL来攻克更难的问题,让采样与训练不必严格同步等待。难题上的收益有限,是GRPO长期存在的一道坎,Never Give Up给出的答案是:先别急着放弃这一批。
热门跟贴