一个397B参数的模型,在Agent基准上从16.11%提升到27.29%,相对提升约70%。但这份训练配方里最扎眼的数字不是70%,而是5.95——只修沙箱和工具,还没开始训练,平均奖励就涨了这么多。
Edward Hu与SkyRL团队联合发布的这套方案,面向复杂知识工作场景,把Agent强化学习从任务环境搭建、Harness优化、Token对齐到分布式系统调优的完整流程都摊开了。核心结论有点反直觉:大规模Agent训练卡住的地方,往往不在RL算法本身。
先修环境,再谈算法
沙箱里缺Python包、PDF工具解析报错、PowerPoint返回None——这些听起来像工程琐事的问题,被单独拎出来当作首要瓶颈。仅修复这几类问题,未训练模型的平均奖励就提升了5.95个百分点,效果相当于跑完一个Epoch的训练。
对比之下,算法侧的改动收益要小得多。文中效果最好的单项算法改进是Prompt Mean,平均奖励提升3.85个百分点。它先在同一个Prompt的Rollout Group内聚合,再对不同Prompt求平均,避免长轨迹主导梯度。相比Token Mean和Sequence Mean,这是更适配Agent场景的聚合方式。
换句话说,环境治理的即时回报,比调一次RL算法更直接。
Token对齐:一个隐蔽的错位
多轮Agent会反复Decode成文本再重新Tokenize,推理侧实际采样的序列,和训练侧以为的序列并不一致。这种Off-policy错位不容易被察觉,却会持续污染训练信号。
方案给出的解法是Token-in-Token-out(TITO):直接保存原始Token ID,从源头消除偏差。训练与推理的一致性,被当作和算法同等重要的工程前提。
收益的泛化能力也被验证过。把评测Harness从Archipelago(MCP工具)换成OpenCode(代码工具)后,模型仍保留大部分奖励提升。但35B模型的迁移效果更好,因为它在训练中形成了更强的代码执行偏好——工具偏好会影响泛化表现。
32个任务先过拟合,再上397B
在把397B模型放进训练集群之前,团队先用32个任务验证链路可学习性。这一步能提前暴露Reward计算、文件Diff工具、Verifier可靠性等问题,避免直接在超大模型上浪费GPU资源。
一个值得注意的观察是:过拟合失败的任务,通常源于评分系统缺陷,而不是模型能力不足。先证明可以过拟合,再比较算法,最后才轮到规模。
Qwen3.5-397B-A17B在APEX-Agents基准上Pass@1达到27.29%,而规模更小的35B模型在该基准上超过了Claude Opus 4.5。这套配方传递出的判断很明确:真正的大规模Agent RL,是模型、数据、工具、环境、Verifier、分布式推理和训练系统共同组成的工程,选定GRPO、PPO或DPPO只是其中一步。
热门跟贴