同一批模型,换个配置排名就变

一项研究让12个开源权重模型在26种同等合理的基准配置下回答ARC、HellaSwag、MMLU和TruthfulQA的3,679道题,只改变选项顺序、提示词措辞及答案读取方式。

打开网易新闻 查看精彩图片

结果并不稳定。gemma4-31b的得分随配置在31%至89%间波动,四个模型在某种配置下排名第一。

配置敏感题目放大了差距

配置敏感题目承载了相邻模型间95.7%的差距。基准压缩方法筛选出的题目,恰是最易受配置影响的。