可验证奖励的强化学习(RLVR)逐渐成为提升大模型推理能力的重要技术路线。在数学和代码任务中,标准答案和编译器能够自动判断输出是否正确,从而为大规模强化学习提供准确、低成本的奖励信号。
然而,创意写作和研究分析等开放式任务通常不存在唯一正确答案。现有方法往往依赖人工偏好、奖励模型或 LLM Judge 评估输出质量,容易受到评估偏差和裁判模型能力的限制,同时还会增加训练阶段的推理成本。如何为开放式任务构造稳定、可扩展且能够自动验证的奖励,成为 RLVR 进一步扩展的关键障碍。
受到自监督学习的启发,作者提出了RLSVR(Reinforcement Learning with Self-Verifiable Rewards)训练框架。自监督学习通过掩码预测、对比学习等代理任务,从数据本身生成训练标签;RLSVR 将类似的任务变换思想引入强化学习,通过构造带有环境隐藏变量和确定性规则的代理任务,让开放式任务也能够产生可验证奖励。
- 论文标题:From RLVR to RLSVR: Task Transformation Induces SelfVerifiable Rewards for Open-Ended LLM Self-Improvement
- 代码链接:https://github.com/wangqinsi1/RLSVR/tree/SpyRL
- 论文链接:https://arxiv.org/abs/2607.23802
基于这一思路,作者进一步提出自博弈训练方法实例SpyRL(Self-PlaY Reinforcement Learning)。其核心是构造一个信息不对称的多智能体博弈环境:不同智能体在掌握信息量存在差异的条件下完成同一目标任务,并通过彼此的输出进行比较、判断和互动。环境预先记录造成信息差异的隐藏状态,因此博弈结果可以被自动、精确地验证;与此同时,智能体能否在竞争中取得优势,又取决于其完成原始任务的质量。由此,开放式任务中难以直接衡量的能力,被映射为可用于强化学习的规则化奖励信号。
从 RLVR 到 RLSVR:
为开放式任务构造可验证奖励
RLVR 能够有效提升数学推理和代码生成能力,关键在于这些任务拥有确定性的验证机制。数学答案可以与标准答案直接比对,代码则可以通过编译器和单元测试判断是否正确,因此模型能够以较低成本持续获得稳定的强化学习信号。
开放式任务的情况更复杂。摘要、写作和研究分析通常不存在唯一答案,任务质量分散在完整性、逻辑性、相关性和创造性等多个维度中,很难通过简单规则直接计算。奖励模型和 LLM Judge 虽然可以提供近似评价,但训练效果会受到评估器能力、偏差和推理成本的影响。
针对这一问题,RLSVR 引入了任务变换(Task Transformation)。其基本思想是将原始开放式任务转化为一个可验证的代理环境,并在环境中主动构造监督信号。环境首先从原始数据中采样任务,再注入并记录一个隐藏变量,例如哪个输入受到扰动、哪部分信息被删除,或某个输出在什么条件下生成。模型仍然需要完成原始目标任务,从而保证训练过程中使用的能力与真实应用场景保持一致;随后,模型通过输出之间的比较和交互,对环境中的隐藏状态作出判断。
由于隐藏变量由环境预先生成并保存,模型的判断结果可以通过确定性规则直接核验。这样一来,原本难以直接衡量的输出质量,就能够通过代理环境中的交互结果转化为强化学习奖励。论文将这种奖励称为自可验证奖励(Self-Verifiable Rewards):它不依赖人工标注或外部裁判,其验证依据来自环境自身的状态和规则,标准答案在任务生成时就已经确定。
从这个角度看,RLSVR 可以视为将自监督学习的思想引入 RLVR。自监督学习通过代理任务从数据中自动生成标签,RLSVR 则通过任务和环境变换自动生成奖励。任务变换对应代理任务,环境隐藏变量对应自动构造的标签,最终得到的规则化奖励可以直接用于 GRPO 等现有强化学习算法。RLSVR 由此提供了一条新的路径:开放式任务的可验证性可以通过环境设计获得,并进一步支持大规模、低成本的模型自我进化。
SpyRL:基于自博弈的 RLSVR 的实例
为了验证 RLSVR 能否真正应用于开放式任务,作者设计了一个基于信息不对称自博弈的具体实例——SpyRL(Self-PlaY Reinforcement Learning)。SpyRL 将摘要、创意写作和数学推理等任务嵌入一个类似「谁是卧底」的多智能体环境中,通过环境预先分配的隐藏身份,为原本缺乏标准答案的任务构造可验证奖励。
如论文图 2 所示,SpyRL 的每轮训练包含Performing和Detection两个阶段。首先,环境从任务数据中采样一个输入,并随机指定一名玩家为 spy。其余 civilian 玩家获得完整输入,spy 则只能看到经过信息降质处理的版本,例如被连续遮盖部分内容的报告、写作提示或数学材料。随后,所有玩家根据各自掌握的信息完成同一个目标任务,生成摘要、故事或数学问题及解答。信息降质只移除影响任务完成的关键内容,同时尽量保持输入的主题、风格和表面形式一致,以避免模型通过长度、格式等简单特征识别身份。
在 Detection 阶段,所有输出会被公开,玩家需要结合这些结果判断谁获得了残缺信息。由于 spy 的身份由环境提前随机指定,投票是否正确能够直接与环境记录进行比较,Detection 阶段也因此获得了确定性的奖励。与此同时,一个玩家生成的内容越不完整、逻辑越薄弱,越容易暴露其信息缺失并收到更多怀疑票。因此,投票结果也可以反向用于评价 Performing 阶段:收到的怀疑票越多,任务执行奖励越低;能够生成更完整、更连贯、更具说服力输出的玩家,则更有可能避免被识别。
这两个阶段共同构成了 SpyRL 的闭环自博弈机制。检测能力提升后,模型能够发现输出中更细微的缺陷,给执行者带来更严格的训练信号;执行能力提升后,不同玩家的输出会变得更难区分,又会推动检测模型继续进化。作者对两个阶段进行交替优化:当检测任务已经较为容易时,训练重点转向执行模型;当执行模型的提升导致身份识别准确率下降时,再增强检测模型。这样的动态过程能够持续围绕模型当前的能力边界产生学习压力,降低固定评估器逐渐失效带来的训练停滞。
在奖励设计上,Detection 阶段根据身份判断是否正确获得可验证奖励,并通过类似 GRPO 的组内相对优势进行优化。Performing 阶段则采用零和奖励,将 spy 与 civilian 之间的竞争以及 civilian 内部的相对表现结合起来。
通过这样的设计,SpyRL 将「输出质量」映射为「输出是否暴露了信息缺失」,再将身份判断结果转化为可由环境直接核验的训练信号。整个训练过程不需要人工标注、奖励模型或外部 LLM Judge,并且执行阶段始终围绕原始目标任务展开,从而保证代理博弈所训练的能力能够迁移回摘要、写作和推理等真实任务。
实验结果
作者在 Qwen3-4B 和 Qwen3-8B 上验证了 SpyRL,实验覆盖文本摘要、创意写作和数学推理三类任务,并与 R-Zero、Absolute Zero 等自进化方法进行比较。评估同时采用任务专用自动指标、GPT-4o 成对 A/B 测试和人工盲测,以考察模型在客观指标和人类偏好下的表现。
在文本摘要任务中,SpyRL 在 GovReport、Multi-News、QMSum、VCSum 和 SAMSum 五个数据集上均取得最高的 ROUGE-L。以 GovReport 为例,Qwen3-4B 的 ROUGE-L 从 30.2 提升至 36.7,Qwen3-8B 则从 29.0 提升至 34.1。在与未经训练的基础模型进行 A/B 测试时,SpyRL 在五个数据集上的平均胜率分别达到 73.9% 和 75.4%,并且在与 R-Zero、Absolute Zero 的对比中赢得了绝大多数测试。这表明,基于身份识别产生的训练信号能够有效改善摘要的完整性、信息覆盖和组织质量。
创意写作上的提升更加明显。作者从新颖性、情感表达、连贯性、一致性和总体质量五个维度进行评估。在 WritingPrompts 和 WritingBench 上,SpyRL 相比基础模型及两种自进化基线,在所有细分维度上的胜率均超过 50%。其中,Qwen3-4B 相比基础模型的总体胜率分别达到 81.3% 和 75.1%,Qwen3-8B 则达到 76.5% 和 78.1%。优势在新颖性和情感表达上尤其突出,说明 SpyRL 带来的改善并不局限于语言流畅度和表面结构,也覆盖了更具主观性的创作能力。
虽然 SpyRL 主要面向缺少确定性奖励的开放式任务,它在数学和通用推理任务上同样取得了稳定增益。在 GSM8K、Math500、AIME 2024、AIME 2025、Minerva、MMLU-Pro 和 GPQA-Diamond 七个基准上,SpyRL 均取得了最佳结果。Qwen3-4B 的七项平均成绩相比基础模型提升 8.97 个百分点,Qwen3-8B 提升 6.16 个百分点。例如,Qwen3-4B 在 AIME 2025 上从 6.7 提升至 20.0,在 GPQA-Diamond 上从 26.3 提升至 41.3;Qwen3-8B 在 Math500 上从 74.2 提升至 81.2。这说明,多玩家竞争和集体判断也能够为已有标准答案的任务提供更细粒度的学习信号。
人工评估也支持这一结论。10 名博士生对 400 个创意写作样本进行了盲测,SpyRL 在 WritingPrompts 上相对基础模型、R-Zero 和 Absolute Zero 的总体胜率分别达到 80.0%、78.5% 和 74.0%,在 WritingBench 上则分别达到 85.0%、80.5% 和 72.0%。
此外,SpyRL 的效果并未局限于主实验所使用的数据分布。将训练语料从政府报告换成 PubMed 科学论文后,模型在 arXiv、PubMed 和 BillSum 三个数据集上的平均 ROUGE-L 从 33.2 提升至 38.1,平均 A/B 胜率达到 70.2%。跨任务实验还显示,摘要和创意写作之间存在双向正迁移,说明 SpyRL 学到的内容组织、完整性和长程一致性等能力能够跨开放式任务复用。
启示
本篇工作为自监督学习与强化学习建立了一条连接。自监督学习的核心经验是:当真实标签难以获得时,可以通过掩码预测、对比学习等代理任务,从数据本身构造监督信号。RLSVR 将同样的思想推进到强化学习阶段:面对缺少确定性奖励的开放式任务,通过任务变换构造代理环境,并由环境预设的隐藏变量和交互规则自动生成奖励。自监督学习通过构造任务获得标签,RLSVR 通过构造环境获得奖励;前者解决「没有标注如何学习」,后者进一步探索「没有验证器如何做强化学习」。
这也意味着,RLVR 的适用范围不必完全受限于任务天然具备的标准答案。过去,数学和代码之所以适合 RLVR,是因为答案检查器和单元测试已经存在;对于写作、摘要和研究分析,RLSVR 将问题转化为如何设计一个与目标能力高度相关、同时具有确定性答案的代理任务。由此,可验证性从任务的一项固定属性,逐渐转变为一种可以通过环境设计获得的训练资源。SpyRL 所采用的信息不对称博弈正是这一思想的实例:环境主动制造一个可记录的隐藏状态,模型对该状态的判断可以被精确核验,而完成判断所依赖的能力又与原始开放式任务紧密相关。
这一视角也为大模型自我进化提供了新的研究方向。现有工作常将重点放在更强的奖励模型、更复杂的评价标准或更大规模的 LLM Judge 上,而 RLSVR 提示我们,还可以系统性地研究代理任务和训练环境本身。未来,不同开放式能力可能对应不同的任务变换方式。随着这些变换逐渐丰富,任务设计本身可能成为继数据、模型和优化算法之后,推动模型自我提升的另一项关键变量。
热门跟贴