打开网易新闻 查看精彩图片

新智元报道

打开网易新闻 查看精彩图片

最近,Apple 联合 Hasso Plattner 研究所发表论文,在 9 个基座模型、11 种语言上做了超过 200 组 GRPO 强化学习推理训练实验。

打开网易新闻 查看精彩图片

https://arxiv.org/pdf/2608.13698

结果显示,用中文做推理训练,与英语训练的性能差距只有 1.1 个百分点,此前同类研究报告的差距是 10 个百分点以上。

GRPO 训练有一个关键设计选择:奖励模型用英语推理,还是用提问者的母语推理。

选英语,模型收到中文问题也会切到英语思考;选母语,模型全程用中文。

此前研究认为母语推理性能代价太大,非英语团队只能默认走英语推理路线。

这篇论文说,代价远没有那么大——对中文来说只有 1 个百分点。这直接改变了路线判断:中文推理模型有条件从训练阶段就跳过英语,走自己的路。

对中文 AI 从业者来说,这是推理模型能否走独立路线的前置条件。

论文同时发现,跨语言迁移广泛有效,但特定模型-语言组合会触发极端性能塌方。

200 组实验回答一个问题:
推理必须用英语吗

此前多项研究报告,强制模型用非英语语言做推理,准确率会下降 10 个百分点甚至更多,「推理必须用英语」几乎成了多语言 AI 领域的默认共识。

Dobler 等人的新论文用大规模对照实验动摇了这条共识:三个模型家族(Qwen3、Gemma 3、SmolLM3),参数规模 1B 到 8B,11 种训练语言,每种语言分别用英语推理奖励和母语推理奖励两套方案训练 500 步,再交叉评估。

结论的关键数字按语言拆开看更清楚。

中文训练的英语优势只有 1.1 个百分点,法语 1.4、德语 1.7、日语 1.6——高资源语言(指语料丰富的语言)普遍在 2 个百分点以内。

差距拉大的是低资源语言:孟加拉语 5.7、泰卢固语 4.6、斯瓦希里语 4.5 个百分点。

打开网易新闻 查看精彩图片

语言本身在预训练阶段积累的资源厚度,直接决定了母语推理训练的性价比。

一种语言训练,多种语言受益

实验中另一个值得拆开看的数据结构,是跨语言迁移矩阵。

论文把 11 种语言分别做单语训练,再在所有 14 种语言上评估,形成一张 11×14 的性能表。

这张表里最直观的信息是:用一种语言训练 GRPO,其他语言几乎都跟着涨。

西班牙语单语训练之后,法语的性能恢复了目标语言直接训练增益的 96%,只差 1 个百分点。中文和日语之间的互相迁移同样明显,中日同属 CJK 语系的预训练共享可能在起作用。

一个反直觉的发现是:英语并不总是最好的迁移源。

在 Qwen3-4B-Base 和 Qwen3-8B 上,孟加拉语训练对中文的迁移效果反而最好。

论文作者推测,低资源语言的训练迫使模型更深层地重组推理能力,这种重组带来的泛化有时比高资源语言训练更强。

多语言混合训练的表现也值得关注。

Qwen3-Base 系列在多语言训练下,与「为每种评估语言分别挑选最优迁移源」的理想方案相比,平均只差 0.3 个百分点,而只需要训练一个模型。

对于资源有限的团队,这提供了一条务实的路径:不必为每种目标语言单独跑训练。

也存在性能崩塌的情况

跨语言迁移的好消息,被一种特定的失败模式冲淡了。

论文发现,某些模型-训练语言的组合会导致其他语言或任务类型上的极端回退,而同一个模型换一种训练语言就完全没有这个问题。

最严重的案例出在 Qwen3 系列非 Base 模型上。

用斯瓦希里语或泰卢固语训练后,这些模型在含英语内容的未见任务上出现了高达 19.2 个百分点的性能崩塌(Qwen3-4B 斯瓦希里语训练),而在训练语言本身上性能正常甚至提升。

换成英语或多语言训练,同一批任务的性能保持稳定。

困难数学任务上的回退更普遍。

Qwen3 非 Base 系列、SmolLM3-3B 在非英语单语训练后,PolyMath 中高难度题目的平均分大面积下滑,部分配置跌幅超过 30 个百分点。

打开网易新闻 查看精彩图片

但同模型在其他任务上表现正常,回退高度集中在特定任务族。

推理奖励语言本身也能触发塌方。

gemma-3-1b-it 用斯瓦希里语数据加母语推理奖励训练后,简单数学任务(MGSM 和 PolyMath-low)的性能比原始模型下降 3.1 个百分点;

但同样的数据搭配英语推理奖励,性能反而提升 17.5 个百分点。

差距超过 20 个百分点,且在同模型的孟加拉语训练中不会出现。

回退无法从模型或语言中单独预测,只有在特定组合下才会暴露。

中文之外
所有非英语生态都在问同一个问题

回到中文从业者最关心的判断——中文推理训练到底能不能用。

从这篇论文的数据看,答案接近「能用」。

中文在所有被测语言中属于差距最小的一档(1.1 个百分点),Qwen3-Base 全系列模型的中文推理奖励训练都能有效控制推理语言,跨语言迁移中中文既是好的接收方也是好的发送方。

这组结果在 9 个模型上一致,不是孤例。

但这个结论的适用范围需要明确:论文测的是 8B 以下的开源模型,任务是程序化生成的数学和逻辑题,单种子实验,没有做逐配置的超参调优。真实部署场景中的表现还需要单独验证。

把视野从中文放宽一步,这篇论文给出的信号对整个非英语 AI 生态都有意义。

过去一年,从阿拉伯语到法语到日语,各语言社区都在问同一个问题:推理训练是否必须绕道英语?

如果答案是「必须」,那非英语模型永远在英语模型的下游做适配;

如果答案是「差距可控」,非英语生态就有可能从推理训练阶段就走自己的路线。

这篇论文把「差距可控」从猜测变成了有数据支撑的判断——至少在高资源语言和中小模型上如此。

差距压缩到 1–2 个百分点之后,从 RLVR 训练阶段就用目标语言跑,就变成一个合理的工程选择,性能代价可以接受。

对中文 AI 来说,中文推理模型有可能从训练源头就走独立路线,跳过英语推理模型的翻译适配层。

但论文同时证明了一件事:「可控」和「安全上线」之间差的是评估覆盖度。

只看目标语言的平均分,回退藏在暗处;逐语言、逐任务、逐模型排查,才能把风险暴露在上线之前。

这 200 组实验最大的贡献,恰恰是证明了这种排查不可省略。

参考资料:https://arxiv.org/pdf/2608.13698

编辑:马可