强化学习训练智能体时,一条轨迹里每个动作的重要性并不相同。但GRPO给轨迹中每个token分配相同的advantage,无法区分哪一步才是决定性的。

ProVer的做法

打开网易新闻 查看精彩图片

ProVer提出一种信用分配方法:先用LLM judge定位轨迹中的关键片段,再由rollout决定该步信用的大小。两步配合,把"哪一步关键"和"这一步值多少"分开处理。

LLM judge负责找出关键片段,rollout负责量化该步的信用大小。这样,轨迹中不同步骤就能拿到不同的信用,而不是被平均对待。

这套方法针对的正是GRPO的短板:同一条轨迹里,每个token拿到相同的advantage,决定性步骤和普通步骤被一视同仁。