在LLM评估中,同一个模型、同一批测试题,用acc(原始准确率)和acc_norm(字节归一化准确率)两个指标打分,结果可能截然不同。问题出在长度偏差上。
长度偏差如何影响acc
打开网易新闻 查看精彩图片
原始准确率acc的计算方式很简单:模型给出的答案与标准答案一致,就算对。但这种方式存在一个漏洞——模型可以通过生成更长、更啰嗦的答案来“刷分”。
当答案变长时,其中包含正确内容的概率也随之增加,即使模型本身并不真正理解问题。acc指标无法区分“真会”和“蒙对”,因此长答案更容易获得高分,这就是长度偏差的来源。
acc_norm的修正逻辑
acc_norm的改进在于:将模型的输出概率按字节长度进行归一化。简单说,就是看模型在“每个字节”上平均分配了多少概率,而不是看整体概率总和。
这样一来,冗长答案的优势被削弱——如果模型靠堆字数提高得分,归一化后每个字节的平均概率反而会下降。acc_norm因此更能反映模型真实的推理能力,而非“话多”的优势。
何时用哪个指标
两者没有绝对优劣,取决于评估目标:
- 生成质量、答案是否完整可用 → 用acc
- 模型理解能力、排除长度干扰 → 用acc_norm
部分场景下,还可以考虑PMI归一化等替代方案,进一步剥离先验概率的影响。理解这些指标的差异,才能避免被单一数字误导。
热门跟贴