配置一变,排名就变

一项研究把12个开源权重模型放进26种同等合理的基准配置里,让它们回答ARC、HellaSwag、MMLU和TruthfulQA的3,679道题。只改选项顺序、提示词措辞和答案读取方式,结果就出现大幅波动。

打开网易新闻 查看精彩图片

gemma4-31b的得分随配置在31%至89%之间摆动,跨度达到58个百分点。四个模型分别在某种配置下拿到过第一名。

差距集中在配置敏感题

相邻模型之间95.7%的得分差距,来自那些对配置敏感的题目。基准压缩方法筛出来的题目,恰好也是最容易受配置影响的一批。