ACL 2026杰出论文奖在圣地亚哥揭晓,全球共18篇入选。美团履约技术团队与北京大学合作的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》位列其中。这篇论文针对强化学习可验证奖励(RLVR)场景,提出了一种几何感知的低秩适配方法。

RLVR与SFT的优化几何存在本质差异

打开网易新闻 查看精彩图片

以OpenAI o1、DeepSeek-R1为代表的大型推理模型,已经把RLVR确立为解锁复杂推理能力的关键范式。但RLVR的训练开销较高,自然的技术选择是用LoRA这类参数高效微调方法来做RLVR。问题在于,LoRA及其变体几乎都是在SFT场景下建立并验证的。

近期一系列机制研究表明,RLVR与SFT的优化几何存在本质差异。SFT通过改写权重的主方向来显式注入新信息;RLVR更像一次受约束的优化,它靠奖励诱导的采样偏置放大模型推理行为,有效更新分散在稀疏的子空间中,并倾向于避开预训练权重的主方向。

RLVR对更新稳定性也很敏感。它需要在类信赖域边界内做策略更新,过于激进或落在主方向上的更新容易引发谱漂移、探索多样性坍塌乃至训练崩溃。把为SFT设计的先验直接搬到RLVR上,就构成了几何错位,后果是效果欠优、能力遗忘甚至训练崩溃。

现有PEFT方法的两重错位

LoRA及其变体是当前的事实标准,它们的关键差异在于采用了什么谱先验。LoRA用高斯和全零初始化,与预训练权重无关;PiSSA对原始权重做SVD,把可训练预算都分配给主奇异方向;MiLoRA则取尾部奇异方向。这些先验主要在SFT场景下被设计和验证,没有考虑RLVR的更新规律。

以PiSSA为例,它把更新强行推到主成分上的强归纳偏置,恰好与RLVR偏好的子空间相冲突,这也预示了实验中更容易崩溃的现象。另一种直观做法是直接对稀疏子空间做稀疏微调,这种方式在更新模式上确实更契合RLVR的偏好,但现代GPU对非结构化稀疏计算并不高效,减少参数量并不意味着效率提升。论文的效率实验里,稀疏微调把训练参数降低68.0%,训练耗时却增加了10.8%。

GeoRA的三步构造

GeoRA要同时解决几何错位和工程错位,目标即定位契合RLVR的稀疏子空间,用低秩稠密的方式去训练它。方法可以拆成三个步骤:

  • 构造几何子空间:基于谱先验和欧氏先验,从预训练权重中筛出更稳定、更可塑的参数区域。
  • 低秩近似构造适配器:用SVD对几何子空间做低秩近似,用以初始化低秩适配器。
  • 建立残差锚点:将残差权重冻结,使模型初始化时函数不变,平滑冷启动并保护预训练结构。

整个过程只在训练开始前执行一次,属于一次性预处理;训练阶段的计算图与标准LoRA完全一致。

在构造几何子空间时,论文用两个互补的掩码从预训练权重矩阵W中筛选参数区域,两者共用同一个稀疏率ρ。谱先验M_Spec强调稳定性,先对W做秩为r的低秩近似得到Ŵ_r,然后选出Ŵ_r中幅值最小的ρ比例位置。直觉上,主成分中的高幅值分量也是高曲率区域,改动它们容易破坏预训练结构;把更新限制在低幅值区域,可以改善RLVR下的谱稳定性。

欧氏先验M_Euc强调可塑性,直接在原始权重W上选出幅值最小的ρ比例位置。这些接近零的参数在预训练中被“用得少”,可调整空间大,能为训练保留足够的自由度。最终的几何约束矩阵取两者的并集:W_Geo = W ⊙ (M_Spec ∪ M_Euc)。

两个掩码看起来规则相似,实际选出的参数集合却很少重叠。例如,在Qwen3-8B上取ρ = 0.2,两者各选中20.0%的参数,但交集只有4.55%,Jaccard相似度仅0.128。这说明它们捕捉的是两类不同的参数区域,是互补而非冗余关系,论文中的消融实验也印证了这一点:去掉任何一个先验都会带来性能下降。

适配对象的变化是核心区别

拿到W_Geo之后,论文对它做SVD,取前r个奇异分量来初始化两个低秩矩阵。这样B_Geo A_Geo就是W_Geo的最优秩-r近似,Eckart–Young定理保证了Frobenius范数下的最优性。

这里有一个容易被忽略的要点:GeoRA取的是W_Geo的top-r方向,而不是原始权重W的top-r。适配对象的变化,是GeoRA与PiSSA/MiLoRA的核心区别。从这个角度看,四种方法的区别可以概括为一句话:LoRA不看权重,PiSSA看主方向,MiLoRA看尾方向,GeoRA先换一个更合适的适配对象,再在其中取主方向。

最后一步是把剩余权重冻结。按照LoRA的缩放约定计算残差矩阵,前向传播时W_res冻结,只有适配器可训练。这个设计带来两个性质:模型初始化时函数不变,平滑冷启动;同时保护预训练结构不被破坏。

实验表现与业务落地

在1.5B到32B的Qwen与Llama模型上,GeoRA在数学、医学、代码三类RLVR任务上稳定优于流行的低秩基线。论文还介绍了该方法在业务Agentic RL中的落地经验。该工作已被ACL 2026接收为杰出论文。