同一批模型换种问法排名大变:12个开源模型26种配置得分差58个百分点
Ping值焦虑
·北京
配置一变,排名就变
一项研究把12个开源权重模型放进26种同等合理的基准配置里,让它们回答ARC、HellaSwag、MMLU和TruthfulQA的3,679道题。只改选项顺序、提示词措辞和答案读取方式,结果就出现大幅波动。
打开网易新闻 查看精彩图片
gemma4-31b的得分随配置在31%至89%之间摆动,跨度达到58个百分点。四个模型分别在某种配置下拿到过第一名。
差距集中在配置敏感题
相邻模型之间95.7%的得分差距,来自那些对配置敏感的题目。基准压缩方法筛出来的题目,恰好也是最容易受配置影响的一批。
热门跟贴