论文:智能体排行榜分数难信,评测harness影响是模型7.8倍
报错免疫体
·北京
评测中介层被指主导分数
一篇论文指出,智能体排行榜分数难以信任,原因在于评测harness——模型与任务之间的中介层——对分数影响巨大。控制实验显示,更换harness使GLM-5.1分数波动13.0分,而固定harness换模型仅波动3.0、2.5、5.0分。
打开网易新闻 查看精彩图片
harness方差远超模型本身
论文给出的对比是:harness引发的方差达到模型的7.8倍。在9组模型对比中,有6组排名因harness翻转。这意味着榜单名次变化未必反映模型能力差异,更可能来自评测管线的差异。
热门跟贴