评测中介层被指主导分数

一篇论文指出,智能体排行榜分数难以信任,原因在于评测harness——模型与任务之间的中介层——对分数影响巨大。控制实验显示,更换harness使GLM-5.1分数波动13.0分,而固定harness换模型仅波动3.0、2.5、5.0分。

打开网易新闻 查看精彩图片

harness方差远超模型本身

论文给出的对比是:harness引发的方差达到模型的7.8倍。在9组模型对比中,有6组排名因harness翻转。这意味着榜单名次变化未必反映模型能力差异,更可能来自评测管线的差异。