一篇论文把12个模型、3679个问题固定下来,只调整提示词格式、选项顺序、打分方式这些常规评测设置,结果排名出现大幅波动。

同一模型得分跨度惊人

打开网易新闻 查看精彩图片

gemma4-31b的得分在31%到89%之间变化。12个模型里有4个至少在一种有效设置下排到过第一。

差距主要来自评测设置

相邻模型之间平均95.7%的差距,来自那些评测设置一改就会翻转答案的题目。最大的不稳定来源是打分方式——到底是生成答案,还是选最高似然选项。