最大似然强化学习
Maximum Likelihood Reinforcement Learning
https://arxiv.org/pdf/2602.02710
摘要
强化学习(RL)是在目标函数只能通过从模型中采样来评估的设置下,训练模型的首选方法。我们的关键观察是,当反馈是终端且二元的时,模型会隐含地诱导出一个关于正确轨迹的似然。在这种设置下,最大似然本应是自然的框架,但强化学习却被用作解决不可微性的变通方法。我们证明,标准的期望奖励强化学习公式仅仅是似然的一阶近似。为了弥补这一不匹配,我们引入了最大似然强化学习(MaxRL),这是一个计算索引的基于采样的目标函数族,随着采样计算的扩展,它在期望奖励强化学习和最大似然之间进行插值。由此产生的目标函数只需对标准强化学习实现进行一行代码的修改。在所有测试的模型和任务中,MaxRL 在帕累托意义上优于现有方法,相较于 GRPO 在测试时扩展效率上实现了高达20倍的提升,并且随着额外的训练数据和计算的增加,其扩展性更为有利。¹
1 引言
最大似然(ML)和强化学习(RL)是两种非常成功的优化范式,它们显著塑造了现代机器学习的格局。最大似然训练是现代生成模型和预测模型背后的基础原则(Bishop, 2006; Murphy, 2012);在完全可微的设置中,优化对数似然目标已可靠地将模型容量、数据和计算的增加转化为持续的性能提升(Krizhevsky et al., 2012; Radford et al., 2018)。相比之下,强化学习起源于最优控制和序列决策(Bertsekas, 1995; Sutton et al., 1998),其中学习通过与环境的交互进行,目标是最大化期望回报。这种公式的通用性使强化学习能够解决涉及不可微中间采样的问题,并催生了在复杂领域具有超人性能的模型(Mnih et al., 2015; Silver et al., 2016; OpenAI et al., 2019; Vinyals et al., 2019)。
许多现代学习问题通常使用强化学习来解决,即使它们定义了关于成功的隐含似然。例子包括导航(Thrun et al., 2005; Anderson et al., 2018)、程序合成(Chen et al., 2018; Bunel et al., 2018)、结构化预测(Smith, 2011; Mensch and Blondel, 2018)以及大型语言模型中的多步推理(Wei et al., 2022; Guo et al., 2025)。在这些任务中,成功仅在随机生成过程之后由外部验证器确定,产生二元结果。从端到端的角度来看,模型为每个输入诱导出成功的概率,定义了关于正确性的隐含似然。最大化这种似然本应是原则性的方法,但不可微的中间采样阻碍了直接优化。强化学习被使用,并非因为它提供了更好的目标,而是作为解决这种不可微性的变通方法。
假设最大似然和强化学习都可以应用于给定的任务,无论可微性如何。那么这两个目标会诱导出显著不同的优化行为,正如我们将在下文解释的那样。为了使这种区别精确,我们比较了每个框架所隐含的总体水平目标。
由最大似然诱导的逆概率重加权对困难的、低成功率的输入赋予了更大的权重,从而导致非常不同的优化动态,正如我们在本文中所实证展示的那样(参见第6节)。
当从端到端来看时,最大似然作为原则性目标出现,其原因与它在具有二元正确性的可微监督学习中成为首选方法的原因完全相同。然而,在不可微问题中,这一目标很难直接优化,因为正确性仅在一个不可微的随机生成过程之后才能被观察到,而且成功概率 p θ ( x ) 可能很小。这种计算上的挑战促使我们提出一个框架,利用额外的采样计算来更忠实地近似基于似然的训练。我们称这个框架为最大似然强化学习(MaxRL)。在高层面上,MaxRL 通过随着更多采样计算的利用逐步纳入更高阶的正确性信息,弥合了标准强化学习与精确最大似然之间的差距,最终在无限计算的极限下恢复似然优化。我们在第7节中讨论了 MaxRL 与这一方向上近期工作(Xiong et al., 2025b; Davis and Recht, 2025)的关系。我们的贡献有三点:
我们将基于正确性的强化学习形式化为一个潜在生成的最大似然问题,并表明标准强化学习仅优化了最大似然目标的一阶近似(参见第3节)。
我们引入了一个计算索引的目标函数族,它通过 pass@k 事件中的麦克劳林展开,在期望奖励和精确最大似然之间进行插值(参见第3节)。
我们分析了一个简单的同策略(on-policy)估计器,其期望梯度恰好与似然目标的计算索引近似相匹配,这意味着增加采样改进的是被优化的目标本身,而不仅仅是减小方差。
在实证上,MaxRL 在我们测试的所有设置中帕累托优于标准强化学习目标(RLOO (Ahmadian et al., 2024), GRPO (Shao et al., 2024))(参见第6节)。具体而言,当有额外计算和数据可用时,MaxRL 显示出更好的扩展趋势,并且在数学推理任务上,在使用完美验证器的情况下,它相较于 GRPO 实现了高达 20 倍以上的测试时扩展效率提升。总之,我们的结果说明 MaxRL 是在基于正确性的领域中扩展强化学习的一个有前景的方向。
2 预备知识
3 最大似然强化学习(MAXRL)
在本节中,我们展示基于期望奖励的强化学习仅优化了最大似然(ML)目标的一阶近似。具体而言,最大似然目标在 pass@k 事件方面允许进行总体层面的展开,而标准强化学习仅优化了一阶项。这表明存在一个计算索引的目标函数族,它纳入了更高阶项,随着分配更多计算而收敛到最大似然。
3.1 最大似然的麦克劳林展开
这对应于仅保留公式 (5) 的首项。根据这一观察,我们可以断言:
强化学习优化的是最大似然目标的一阶近似。
3.2 MaxRL 目标函数
公式 (5) 中的最大似然梯度很难用固定数量的样本进行估计。特别是,估计大 k 的 pass@k 梯度需要越来越多的样本,尤其是当通过率 p 很小时。这种有限样本的困难正是促使我们提出最大似然强化学习的原因。我们将 MAXRL 定义为一类明确以最大似然目标而非通过率为目标的强化学习方法,同时在固定采样和不可微生成下保持可实现性。我们考虑一种原则性的方法来做到这一点。
考虑通过将麦克劳林展开(公式 (5))截断到固定的有限阶,然后转而估计这样的目标来近似最大似然目标。对于截断水平 T ∈ N ,我们将固定输入 x 的截断最大似然目标定义为:
剩下的问题是,这些截断目标在固定采样预算下是否允许简单、无偏的估计器,我们将在下一节中肯定地回答这个问题。
4 MAXRL 的梯度估计器
公式 (7) 已经提供了一种构建无偏估计器的可行方法:使用近期工作中提供的 pass@k 梯度估计器来近似有限级数中的每一项(Walder and Karkhanis, 2025; Chen et al., 2025b)。在这种策略下,pass@k 估计器的任何改进都直接转化为我们在公式 (7) 中提供的截断最大似然目标的改进估计器。
在这项工作中,我们采取另一种方法。关键的洞察是,最大似然梯度可以表示为成功条件分布下的期望,这由以下定理确立(Davis and Recht (2025) 最近也做出了类似的观察)。
定理 1(最大似然梯度的条件形式)。最大似然目标的梯度允许以下条件期望表示:
我们在附录 C 中提供了该定理的证明。该定理确立了最大似然梯度仅是来自成功轨迹的平均梯度。这种解释通过将期望替换为对成功 rollout 的样本平均,自然地导出了一个具体的梯度估计器。
4.1 经验梯度估计器
我们在附录 C 中给出了这一结果的证明。定理 2 揭示了公式 (9) 中的估计器与公式 (7) 中截断麦克劳林展开的梯度之间优雅的一致性。值得强调该估计器最重要的性质:
增加作为 rollout 的计算量 N 会带来对最大似然梯度的更好近似。
表 1 将我们的估计器与 REINFORCE 估计器进行了比较,后者的期望值是大多数 RL 算法的基础。在估计器层面,区别很简单:两者都对采样的轨迹上的得分函数取平均,但 REINFORCE 按总样本数 N 进行归一化,而 MAXRL 按成功样本数 K 进行归一化。这种归一化上的差异决定了每个估计器对哪个目标是无偏的。
因此,增加两个估计器的样本数量 N 会产生不同的效果:REINFORCE² 降低了固定目标(pass@1)的方差,而 MAXRL 提高了对最大似然的近似阶数。因此,对于 MAXRL 而言,额外的计算改善的是目标本身,而不仅仅是估计质量。
4.2 通过控制变量进行方差缩减
与 REINFORCE 一样,当成功样本数 K 很小时,公式 (9) 中的估计器可能会表现出高方差。策略梯度基线通常被引入以在不改变期望梯度的情况下降低方差(Sutton et al., 1998, 1999)。然而,策略梯度基线的标准论证并不直接适用于此设置,因为该估计器按随机变量 K 进行归一化,而 K 依赖于所有样本,使其与观测到的 rollout 相关。
我们转而从第一性原理出发,使用一个简单的零均值控制变量,即无条件平均得分:
4.3 同策略(On-Policy)实现
最后,我们提出了一个简单的 MAXRL 同策略实现,它与标准的 REINFORCE 风格策略梯度方法的区别在于对优势计算的单行修改。我们采用公式 (10) 中的方差缩减公式,并在 K = 0 时舍弃两项,这与标准策略梯度实践(Yu et al., 2025; Nie et al., 2026)一致,即对于没有成功 rollout 的任务不计算梯度:这种选择更简单,并且在经验上表现更好。具体而言,优势由每个任务的平均奖励进行归一化,而不是像 RLOO(Ahmadian et al., 2024)那样保持未归一化,也不是像 GRPO(Shao et al., 2024)那样由奖励标准差进行归一化。修改的部分用蓝色高亮显示。
5 一个统一的权重函数视角
最大似然、MAXRL、经典强化学习和 GRPO 都允许以下形式的总体层面梯度:
这种权重视角也为 GRPO(Shao et al., 2024)提供了有用的重新解释。尽管 GRPO 在启发式上是由使用经验标准差的 Z-归一化驱动的,但这种归一化诱导出了一个与 REINFORCE 根本不同的总体层面目标,这一结论也被近期工作(Davis and Recht, 2025; Liu et al., 2025b; Xiong et al., 2025b; Yang et al., 2026a; Thrampoulidis et al., 2026)所得出。
表 2 总结了总体层面的加权函数。相对于标准的期望奖励优化,GRPO 对低通过率输入赋予更高权重——
——如图 1 所示,对于足够大的通过率,GRPO 的加权函数会反转,随着 p → 1 而增大,这与基于似然的目标不同。因此,与其他公式相比,GRPO 在存在非常简单输入时会赋予它们更高的权重。³
6 实验
我们现在转向对 MAXRL 的实证评估。我们首先在第 6.1 节中从一个可控设置开始,在该设置中精确的最大似然优化是可能的,从而允许随着计算增加直接与 MAXRL 进行比较。然后,我们在两种机制下研究不可微的基于正确性的任务:(i) 具有大量新颖任务的实际上无限数据设置(第 6.2 节),以及 (ii) 具有固定训练数据集的数据稀缺设置,在该设置中我们可以通过对同一数据集训练多个 epoch 来非平凡地扩展计算(第 6.3 节)。最后,在第 6.4 节中,我们在数学问题求解上训练和评估十亿参数级的推理模型,测试 MAXRL 的优势是否能扩展到更大规模的 LLM 训练。
因为我们比较的是训练目标而非算法,所有方法都采用同策略训练。我们与 RLOO(Ahmadian et al., 2024)和 GRPO(Shao et al., 2024)作为主要基线进行比较。
以下是这两张图片内容的合并直译:
6.1 与精确最大似然的比较
作为第一步,我们评估 MAXRL 在能够精确实现最大似然的设置中,对精确最大似然的逼近程度。我们比较三个目标:(i) 基于期望奖励的强化学习,(ii) MAXRL(一种固定的基于样本的目标),以及 (iii) 精确最大似然训练。我们考虑一个标准的图像分类任务,其中精确 ML 目标对应于最小化交叉熵。RL 奖励定义为:如果预测类别与真实标签匹配则为 1,否则为 0。我们在 ImageNet(Deng et al., 2009)数据集上使用基于 ResNet-50(He et al., 2016)的分类器,并在每个目标下进行训练,从而实例化这一比较;完整的实验细节见附录 H。图 2 总结了结果:REINFORCE(带有标准基线)即使在非常高的每输入采样预算下也无法实现有意义的改进,而精确最大似然训练在平均性能(Pass@1)和覆盖率(Pass@k)上都能稳步提升。
相比之下,MAXRL 在与 REINFORCE 相同的样本上训练,并观察到相同的稀疏成功轨迹集,但通过受似然启发的重加权,更有效地利用了这种有限的学习信号。随着计算量通过更高的 rollout 数量增加,MAXRL 持续改进,并紧密跟踪精确最大似然。我们还在图 8 中分析了不同目标所产生的梯度范数:MAXRL 和交叉熵将学习信号集中在更困难的任务上,并且在 MAXRL 获得足够计算时具有特征上的相似性,而 GRPO 和 REINFORCE 则表现出非常不同的行为。关于额外实验(例如与 GRPO 的比较),我们请读者参阅附录 H。
6.2 无限数据机制
接下来,我们在不可微的设置中研究 MAXRL。对于第一个实验,我们研究 MAXRL 在数据丰富领域中的表现。为了模拟无限数据训练,我们构建了一个程序生成的迷宫导航环境,包含 100 万个独特的 \(17 \times 17\) 迷宫用于训练,其中对于给定任务可能存在多条有效解路径。我们保留了一个包含 256 个迷宫的留出集用于评估,并应用了一个简短的监督预训练阶段,以确保非零的初始通过率。任务的完整细节见附录 I。
我们训练了一个约 300 万参数的轻量级 transformer 模型(Vaswani et al., 2017),并通过以 256 的批量大小运行 9,000 步 RL 来模拟扩展训练。我们在图 3 中报告了 9,000 步后的性能,作为训练计算的函数,通过每个提示词不同数量的 rollout(从 4 到 128)来实现,同时保持其他超参数不变。请注意,对于我们特定的模型规模而言,这是一笔相当可观的计算量。
所有三个目标(RLOO、GRPO 和 MAXRL)都优于基础模型,但改进的幅度在不同方法之间差异显著。即使在最高的计算预算(每个提示词 128 次 rollout)下,RLOO 在所有 pass@k 指标上都无法达到 MAXRL 在最低预算(4 次 rollout)下所取得的性能。在最高计算量下训练的 GRPO 模型,在每次 pass@k 评估中同样落后于仅用每个提示词 16 次 rollout 训练的 MAXRL。这些结果凸显出,当存在大量独特训练数据时,MAXRL *随计算扩展* 的效率远高于竞争框架。此外,尽管*没有重复数据*,GRPO 和 RLOO 的 pass@k 与 pass@1 之间几乎没有差距,这表明这些算法已经失去了进一步改进的能力,而 MAXRL 则有显著差距,并有可能在给定额外计算的情况下进一步改进。与额外基线的比较见表 3 和附录 L。
6.3数据稀缺制度
我们接下来考虑一种数据稀缺机制,其中模型在固定数据集上训练多个 epoch 直至达到峰值性能,目的是确定哪种方法能提取出最高的可达到性能。与第 6.2 节中的无限数据设置不同,在这种机制下,更长的训练并不一定会转化为性能提升,因为过拟合风险增加了。具体而言,我们在 GSM8K(Cobbe et al., 2021)上训练 SmolLM2-360M-Instruct 模型(Allal et al., 2025)长达 50 个 epoch。训练动态报告在图 4 中,额外的实验细节见附录 J。
所有方法在 pass@1 性能上都优于基础模型;然而,只有 MAXRL 在 pass@k 指标上持续超越基础模型。相比之下,RLOO 和 GRPO 随着训练的延长表现出严重的 pass@k 退化,这与 Yue et al. (2025) 观察到的行为一致,并且在此处由于在固定数据集上的长时间训练而加剧。RLOO 和 GRPO 比 MAXRL 更快达到其峰值 pass@1 性能(大约 10 个 epoch),但 MAXRL 在大约 30 个 epoch 时超越了竞争方法,并持续增长直至训练结束,达到更高的峰值。同时,MAXRL 的 pass@k 在大部分训练过程中保持显著更健康,并超越基础模型。这种行为表明 MAXRL 对过拟合更具抵抗力,特别是在输出多样性方面。与基线方法的额外比较报告在表 5 中。
6.4 大型推理模型训练
我们接下来证明 MAXRL 的优势可以扩展到更大规模的 LLM 推理训练。我们在 POLARIS-53K(An et al., 2025)上训练 Qwen3-1.7B-Base 和 Qwen3-4B-Base 模型,这是一个包含约 50,000 个数学推理提示词的数据集,使用每批 256 个提示词、每个提示词 16 次 rollout 以及 1000 步 RL。请注意,此设置使用了比先前实验更低的 rollout 数量和 RL 步数,以便在我们的计算预算内训练更大的模型。我们在四个标准数学基准上进行评估:AIME 2025、BeyondAIME(ByteDance-Seed, 2025)、MATH-500(Hendrycks et al., 2021; Lightman et al., 2024)和 Minerva(Lewkowycz et al., 2022)。我们与 GRPO(Shao et al., 2024)进行比较,后者是大规模推理中广泛使用的基线(Guo et al., 2025; Yang et al., 2025)。额外细节见附录 K。
图 5 总结了我们的主要结果。在两种模型规模上,MAXRL 都持续在帕累托意义上优于 GRPO,在实现更高 pass@1 的同时改善 pass@k。与先前工作一致(Yue et al., 2025; Wu et al., 2026),GRPO 在更大的 (k) 值下表现出明显的 pass@k 退化。相比之下,MAXRL 在 8 个评估设置中的 7 个里,相对于预训练基础模型和 GRPO 训练的检查点都改善了 pass@k。改善的 pass@k 直接转化为重复采样下的推理效率。如图 5 所示,当使用完美验证器过滤错误解时,MAXRL 实现了高达 20 倍的测试时扩展效率提升,在推理时带来了实质性的计算节省。我们注意到,许多设置都允许使用强验证器,例如编程(Chen et al., 2021)或 Lean(de Moura et al., 2015),在这些场景中 MAXRL 可以展现出相对于其他 RL 目标的强大优势。我们在附录 K.3 和 L 中提供了额外结果,例如在 4 个额外基准上的评估,以及与额外基线的比较。
6.5 MAXRL 的行为分析
最后,我们研究 MAXRL 在性能指标之外,是否相较于常用的 RL 目标展现出不同的特征。我们首先研究不同目标所产生的梯度范数:图 6 表明,MAXRL 在更困难的提示词上产生更高的梯度范数,在更容易的提示词上产生更低的梯度范数。这种行为与完全可微图像分类设置中交叉熵的行为相匹配(图 8),表明 MAXRL 将学习信号集中在更困难的问题上,这与 GRPO 和 RLOO 不同。这些在更困难提示词上更大的梯度范数,随后转化为模型在训练期间为更大比例的问题生成正确解的能力。图 7 展示了这一趋势,因为 MAXRL 持续为更大比例的训练提示词生成至少一个正确 rollout,并且随着我们训练更长时间,MAXRL 与 GRPO 之间的差距持续存在。附录 M.1 在迷宫和 GSM8K 训练设置中进一步证实了这些发现。此外,图 14 表明 GRPO 和 RLOO 将每个提示词的通过率分布推向 0 和 1 的极端,这与分布锐化的叙述一致,而 MAXRL 在整个训练过程中保持广泛的通过率分布。最后,图 29 中的逆信噪比(SNR)分析表明,随着 rollout 预算的增加,MAXRL 变得更加稳定,尽管来自成功率极低((p \to 0))问题的学习信号被更强地放大。附录 M 进一步考察了 MAXRL 和 GRPO 在分布锐化和非二元奖励设置中的差异。总的来说,这些结果表明 MAXRL 与其他 RL 目标存在显著差异,我们将对这些差异进行更深入的探究留待未来工作。
密切相关的工作。一条密切相关的工作路线是 Xiong et al. (2025b),该工作也考虑了强化学习中通过率的非线性函数。他们的工作和我们的工作都受到这样一个观察的启发:期望奖励目标可能会低估低通过率的提示词,而最大化类似对数似然的目标可以缓解这个问题。然而,Xiong et al. (2025b) 的重点是自适应 rollout 预算分配和采样策略,将通过率的非线性加权视为算法设计空间的一部分。相比之下,我们不采用自适应采样,而是推导出一个基于采样的同策略估计器,随着 rollout 计算预算的增加,该估计器趋近于最大似然。我们还着重于实证展示我们的框架具有更好的数据和计算扩展性,而 Xiong et al. (2025b) 则侧重于与其他自适应采样框架(Yu et al., 2025)进行比较。此外,Davis and Recht (2025) 提供了一个理论论证,刻画了特定二元奖励强化学习算法在渐近极限下所趋近的总体层面目标,表明某些过程会诱导出通过率的类对数加权。我们的工作解决了一个互补的问题:有限采样如何定义明确的总体层面目标。我们在每个有限 rollout 数量下建立了精确的估计器-目标等价性,并在受控设置和大规模 LLM 后训练实验中实证评估了这种目标层面的插值如何随着计算增加而体现。我们在附录 B 中讨论了额外的相关工作。
8 结论
在这项工作中,我们将最大似然强化学习确立为非可微二元奖励设置下一个原则性的优化框架。我们表明,MAXRL 在可微设置中随着计算增加而趋近于最大似然,并且在不可微设置中,它相较于传统 RL 提供了关键优势,能够更有效地随额外计算和数据扩展。更广泛地说,我们的结果表明,一些归因于使用基础模型进行强化学习的局限性,源于目标选择而非优化或采样。我们的工作目前假设二元奖励设置,并不直接扩展到连续或任意赋值的奖励。此外,人们也可以考虑按照我们的框架优化最大似然以外的目标。将 MAXRL 推广到连续奖励、多轮强化学习以及诸如 PPO 风格训练之类的离策略设置,是未来工作的有前景方向。
原文链接:https://arxiv.org/pdf/2602.02710
热门跟贴