一项覆盖超过19万次评估尝试的研究发现,大模型在充当评判者时并不像想象中那么独立。当修订、尝试和先前得分字段作为上下文元数据出现时,评分会系统性地向这些先前得分偏移。研究作者指出,即使仅作为上下文元数据提供,先前得分也会锚定判断,并系统地将评分向其值偏移。

小标题:效应量达到0.71,七种模型均受显著影响

打开网易新闻 查看精彩图片

研究团队在八种语言模型上对二十段固定文本进行了超过192,000次评估尝试,设置了三种提示条件:无元数据、修订框架,以及包含修订、尝试和先前得分字段的锚定元数据。结果显示,先前得分充当了锚点,使判断向其值偏移。衡量得分分布差异的标准化指标Cohen's d绝对值达到0.71。

更值得注意的是,八种模型中有七种的总锚定元数据效应的自助区间低于零。这意味着偏差不是个别模型的偶然波动,而是一种跨模型的系统性现象。研究作者强调,这一效应在统计上具有显著意义,不能归因于随机误差。

小标题:类别判断同样被扭曲,正确标签被翻转

这种锚定效应不仅体现在数值评分上,还延伸到了类别决策。在有人工标注真值的行业类别数据上,锚定元数据阻止了48%的错误更正。也就是说,当模型原本有机会修正错误判断时,接近一半的修正被先前得分拦住了。

更令人担忧的是,10.18%的正确判断被翻转为分配的错误标签。这意味着锚定元数据不仅阻碍了纠错,还主动制造了新的错误。研究作者在论文中明确写道:在有人工标注真值的行业类别数据上,锚定元数据阻止了48%的错误更正,并将10.18%的正确判断翻转为分配的错误标签。

小标题:思维链和警告都没能消除偏差

研究团队尝试了两种常见的缓解手段:思维链提示和忽略元数据的警告。结果都不理想。思维链提示或忽略元数据的警告均未减少总体锚定效应。唯一的微弱改善出现在行业实验中,警告相对于基线略微提升了配对准确性,但这一提升远不足以抵消锚定效应带来的损害。

这一发现对当前广泛采用的LLM-as-a-Judge实践提出了直接挑战。许多评估流程会把历史得分、修订记录或尝试次数作为上下文提供给模型,期望模型能利用这些信息做出更准确的判断。但研究结果表明,这些看似中性的元数据实际上在悄悄操纵模型的输出。

小标题:上下文工程才是可靠评估的关键

研究作者给出的结论很明确:可靠的LLM评估需要仔细的上下文工程,而不是假设其公正性。具体来说,评估系统的设计者需要根据具体模型和任务来调整输入上下文,不能默认模型会自动忽略无关的元数据。

对于正在构建AI评估流水线的团队来说,这意味着需要重新审视输入给模型的所有字段。修订历史、尝试次数、先前得分这些信息是否真的必要?如果必须提供,是否应该改变呈现方式以降低锚定效应?研究没有给出统一的解决方案,但明确指出了一条底线:不能假设模型是公正的。