Arena 对比了 12 个模型的 34,580 条判定,以及 1,460 场盲测对战的人类投票,结果指向一个不太体面的习惯:AI 评委平均有 58% 的时间把票投给自己的答案。
同一批对战里,人类只有 34% 的时间选择了同一个答案。两个数字摆在一起,差距不是几个百分点,而是接近一倍。
打开网易新闻 查看精彩图片
自选率最高的那个
12 个模型里,GPT-6 Astra 的自选率最高,达到 88%。也就是说,在绝大多数它参与评判的对局中,它都认为自己的回答更好。
这个数字来自对判定记录与人类盲测投票的交叉比对,而不是模型自己的声明。人类投票是在不知道答案出自哪个模型的前提下完成的。
58% 与 34% 之间
AI 评委的 58% 和人类的 34%,衡量的是同一件事:在盲测对战中被选中的那个答案,是否就是评委自己给出的答案。
人类评委的 34% 说明,多数情况下人类并不认为自己的答案更优。AI 评委的 58% 则相反,它更倾向于站在自己这一边。
34,580 条判定和 1,460 场盲测对战,构成了这次对比的全部样本。
热门跟贴