Gemma 4的推理能力是怎么被"调"出来的?NVIDIA旗下Nemotron Labs发了一篇博客,专门讲这件事——不是讲模型怎么训出来的,而是讲训完之后又做了什么。

这篇内容的核心,是后训练(post-training)这条流水线。按博客的说法,团队用了一套系统化的方法对Gemma 4做微调,目标是提升它在推理和校准两方面的表现。

先看结果:两个基准上的变化

博客给出的效果落点是两个推理类任务:MATHGSM8K。这两个都是数学推理方向的评测集,后训练之后,Gemma 4在这两项上的表现有提升。

值得留意的是,博客把"校准"和"推理"并列提了出来。推理好理解,校准(calibration)指的是模型对自己答案的置信度是否靠谱——答对了是不是真的"知道"自己对,答错了有没有相应的不确定感。这两件事在数学题场景里经常一起出问题。

后训练流水线里有什么

按博客的描述,这条流水线主要包含几个环节:

  • 数据集的选择——不是随便拿数据喂,而是有筛选标准
  • 迭代式的精修过程——不是一次调完就结束
  • 针对校准漂移(calibration drift)的处理

其中"校准漂移"这个词值得单独拎出来。它指的是模型在训练或微调过程中,置信度和实际正确率之间的对应关系发生偏移——本来答对时信心高、答错时信心低,调着调着这个关系就乱了。博客提到,迭代精修的过程正是为了解决这个问题。

这套流程的看点在哪

后训练现在是大模型落地里绕不开的一环。预训练决定模型的下限,后训练很大程度上决定它在具体任务上好不好用。Nemotron Labs这篇博客的价值,是把"怎么选数据、怎么迭代、怎么盯校准"这些通常藏在工程细节里的东西摊开来讲。

不过要说明的是,这篇内容本身篇幅很短,属于博客导读性质,具体的数据配比、迭代轮次、参数设置这些细节都没有展开。想深挖的话,得去看Nemotron Labs那篇原始博客。

对做模型微调的人来说,这个方向至少提供了一个思路:推理能力和校准能力可以放在同一条后训练流水线里一起处理,而不是分开各调各的。