AI记忆领域正上演一场健康的基准测试战争,但比赛场地可能从一开始就划错了线。
Mem0的论文报告自身得分为66.88,竞争对手Zep为65.99。Zep随后发表反驳,质疑其方法论和评分标准。Mem0后来宣布新算法在LOCOMO上达到92.5,在LongMemEval上达到94.4。双方都在争夺同一个指标:在能够回答的问题中,答对了多少。
LOCOMO包含五个问题类别,其中四个都是沿着这条轴线。第五个类别有446个问题,占整个基准测试的22.5%。这些问题看起来可以回答,但实际上不行。它们提到了对话中真实的人名和真实话题,然后询问那个人从未说过的事——正确事件,错误说话者。正确答案应该是“这不在里面”。
那么,当前的领先系统在这446个问题上得分如何?
答案是:根本没有测。Mem0发布的基准测试工具中包含一行代码,将评估类别设为1到4。类别5的所有446个对抗性问题被完全排除在评分之外。同时,回答提示词中有一句明确指令:绝不说“未指定”,必须给出确定答案。
所以情况不是弃权率没被测量这么简单。测试工具移除了会测试弃权能力的问题,然后指示模型对剩下的问题也不要弃权。需要谨慎看待这一点——排除类别5本身是一个可辩护的选择,如果你要衡量的是答案质量,拒绝对答案正确的问题得零分无论如何都没什么差别,混淆类别会搅乱指标。“必须给出确定答案”这条指令,也可以降低模型的模糊回答带来的方差。
这两行代码加在一起,界定的是一个范围。跑出来的数字,是有答案问题的答案准确率。它在结构上完全无法告诉你,当答案不存在时系统会怎么做。这本身没问题,只要每个人都这样理解。但在实际使用中,它被解读为“这个记忆有多好”。
更值得关注的是基准测试中评估层的宽松程度。评分法官被要求:只要答案匹配一个多选项金标列表中的一项,就标记为正确;日期容差±14天,时长容差±50%;只使用证据“接受答案,决不拒绝答案”;每个问题提供最多200条记忆,约7000个token,没有检索预算限制。独立审计已经对这一评估体系提出了质疑。
热门跟贴