打开网易新闻 查看精彩图片

当 AI 助手把你的新职位说错时,我们很容易把它归结为:模型又在「胡说八道」。

但错误一定发生在回答的那一刻吗?

想象一下,你已经告诉助手自己刚刚升职。它可能在整理对话时就记错了职位,也可能保留着旧记录、没有完成更新,还可能拿到了正确记忆,却在回答时换成另一个头衔。最后呈现给用户的,都是一句错误答案。

同样是「答错」,背后却可能是完全不同的记忆故障。

中国电信研究院与上海记忆张量( MemTensor )公司等研究者围绕这一问题提出了HaluMem:首个面向智能体记忆系统的操作级幻觉评测基准。它将评测深入到记忆提取、记忆更新和记忆问答三个环节,追踪错误究竟在哪里产生,以及如何影响后续回答。

该工作已被自然语言处理领域顶级会议EMNLP 2026 主会接收。

如果一本笔记在写入时就记错了,之后再熟练地翻阅,也可能只是更准确地找回错误。要判断 AI 的记忆是否可靠,我们需要检查这本「笔记」是怎么写成、怎么修改、又怎么被使用的。

打开网易新闻 查看精彩图片

  • 论文题目: HaluMem: Evaluating Hallucinations in Memory Systems of Agents
  • 作者: Ding Chen、Simin Niu、Kehang Li、Peng Liu、Xiangping Zheng、Bo Tang、Xinchi Li、Feiyu Xiong、Zhiyu Li
  • 开源项目: https://github.com/MemTensor/HaluMem
  • arXiv 论文:https://arxiv.org/pdf/2511.03506

1. 一个被最终答案遮住的问题:

AI 是答错了,还是早就记错了?

记忆系统让 AI 能够在一次次对话之间保留用户信息:你从事什么工作、喜欢什么、最近经历了哪些变化。可一条信息从聊天记录走向最终回答,中间还要经历提取、存储、更新和检索。

现有记忆评测主要采用端到端问答:给系统输入一系列对话,再提出问题,比较回答与标准答案。这能衡量系统最后答得怎么样,却很难说明它为什么答错。

HaluMem 的切入点,是为中间操作也提供可以核对的标准答案。

打开网易新闻 查看精彩图片

图 1:HaluMem 与现有评测方式的对比。除了检查最终回答,还要检查记忆在提取和更新时是否已经发生偏差。(论文图 2)

例如,用户说「我最近开始喜欢鹦鹉了,以前确实不喜欢」,系统却提取成「用户不喜欢鹦鹉」。错误已经发生在写入记忆的第一步。再如,用户明确表示健康状况变差,系统却按照助手的错误回忆,将健康状态更新为「良好」。即使后续检索没有出错,回答也已经建立在错误记录之上。

还有一种更隐蔽的情况:助手自己编出的细节,被记忆系统当成了用户事实。 对话中,AI 可能顺口提到一个并不存在的朋友或经历;用户没有明确确认,系统却把它存进了长期记忆。一次未经证实的表达,就可能成为下一次回答的「依据」。

因此,HaluMem 分别检查三个问题:

  • 记忆提取:该记的信息是否被完整、准确地记录?有没有把虚构细节也写进去?
  • 记忆更新:新信息出现后,旧记忆是否得到正确修改?有没有漏改、改错或留下冲突?
  • 记忆问答:系统最终能否利用记忆给出正确回答?错误回答与因信息缺失而无法回答,各占多少?

这些检查按对话时间顺序展开,在相关会话处理完成后立即触发。由此,评测不再只得到一个总分,还能看到不同操作阶段的具体问题。

2. 给 AI 一段跨越十余年的「人生」,

再加入百万 token 的干扰

要检查记忆有没有出错,首先需要知道:在每一个时刻,系统究竟应该记住什么?

真实聊天记录往往缺少这样的完整标注。用户的偏好会改变,旧信息会过时,有些事实还藏在上下文里。仅在对话结束后补几个问答,很难还原整条记忆演变过程。

HaluMem 为此设计了一条以用户为中心的六阶段数据构建流程:从用户画像出发,建立人生发展骨架,再展开为事件流,生成对应的会话摘要和记忆点,最后生成多轮对话与评测问题。

打开网易新闻 查看精彩图片

图 2:HaluMem 的六阶段构建流程。从用户画像、人生骨架和事件流出发,将应记录的记忆点与实际对话、评测问题关联起来。(论文图 3)

这套流程模拟了跨度为10—20 年的用户经历。职业变化、健康状态、兴趣偏好和人际关系沿着时间推进,形成画像、事件、关系三类记忆。发生更新时,数据保留新旧信息的对应关系,让「该怎么改」也有据可查。

生成对话时,研究者还加入了助手误引或虚构细节等干扰,以及隐含表达和指代。系统既要找到值得保存的信息,也要判断哪些说法没有得到用户确认。

在此基础上,HaluMem 提供两个版本:

  • HaluMem-Medium:覆盖 20 位用户,共 30,073 轮对话,平均每位用户约 16 万 tokens,包含 14,948 个记忆点和 3,467 个问答。
  • HaluMem-Long:保留相同的有效记忆,在会话内部和会话之间插入无关对话,将每位用户的上下文扩展到百万 token 量级,总对话数达到 53,516 轮。

这组设计的关键在于:Long 版本主要增加的是干扰与上下文负担,而不是需要记住的核心事实。 因而,两组结果的差异可以帮助观察系统能否在更长、更嘈杂的交互中持续保留有效信息。

问题也不只考「记没记住」。六类问答覆盖基础事实回忆、多跳推理、动态更新、记忆边界、泛化与应用、记忆冲突。例如,既要知道用户现在的状态,也要识别问题中的错误前提,或承认某条信息从未被提供。

为检查数据质量,研究者对 Medium 中的700 段会话进行了人工评估,覆盖超过一半的会话,并核查其中的记忆点与问答。人工检查得到的正确率达到95.70%。

3. 六套系统实测:

记得多、改得少,都可能掩盖问题

研究评测了 Mem0、Mem0-Graph、Memobase、MemOS、Supermemory 和 Zep 六套记忆系统,并在两种上下文规模下分别测试。

为统一评测条件,更新任务检索前 10 条相关记忆进行核验,问答任务检索前 20 条记忆,并统一使用 GPT-4o 生成答案。以下数值均来自论文主实验设置;Zep 因其官方接口无法获取会话级的记忆提取记录,未报告记忆提取指标。

打开网易新闻 查看精彩图片

表 1:六套系统在记忆提取、更新和问答任务上的结果。将多个指标放在一起,才能区分信息覆盖、内容正确性与遗漏问题。(论文表 3)

发现一:记下了更多内容,不代表记忆更可靠

在 Medium 上,Mem0 和 Mem0-Graph 的记忆召回率分别为42.91% 和 43.28%,Memobase 为14.55%。也就是说,相当一部分应该被记住的信息,在提取阶段就没有被完整保留下来。

上下文扩展到 Long 后,三者的召回率进一步降至3.23%、2.24% 和 6.18%。核心记忆没有改变,仅仅增加无关对话,就足以让部分系统漏掉绝大多数目标信息。

但另一端也有难题。MemOS 在 Long 上的召回率达到81.90%,Supermemory 达到53.02%;二者覆盖了更多目标记忆,同时也暴露出干扰过滤不足的问题。

HaluMem 用虚假记忆抵抗能力(False Memory Resistance,FMR)衡量系统能否忽略那些由助手提及、却未经用户确认的干扰记忆。该指标越高越好。在 Long 上,MemOS 和 Supermemory 的 FMR 分别为28.85% 和 36.86%。

这意味着,扩大信息覆盖并没有自动带来更强的真假辨别能力。

可靠记忆需要同时做到两件事:该记的不能漏,不该信的不能存。单看召回率或记忆条数,都容易忽略另一侧的代价。

发现二:更新幻觉率不到 1.2%,为什么仍然不可靠?

如果只看更新幻觉率,结果似乎相当乐观:主实验中,所有系统在两个版本上的这一指标都低于 1.2%。

但把遗漏率放在旁边,情况就完全不同了。

在 Long 上,六套系统中有五套的更新遗漏率超过60%。其中,Mem0 和 Mem0-Graph 分别达到98.51% 和 98.40%,对应的正确更新率仅为1.45% 和 1.47%。MemOS 的正确更新率最高,为65.25%,但仍遗漏了约三分之一的目标更新。

为什么「很少改错」会和「大量漏改」同时出现?

因为更新幻觉率衡量的是目标更新中发生错误更新的比例。当大量更新根本没有完成时,错误更新的比例也可能很低。 仅凭这一项数值,无法判断系统是否真正掌握了记忆更新。

而且,更新还依赖前面的提取:如果旧事实从未被存入记忆,后续就缺少可以更新的对象。操作级评测因此揭示了一个重要关联 —— 更新不足,可能从记忆第一次写入时就已经开始。

发现三:上游记忆的问题,最终会出现在回答里

在统一问答设置下,所有受测系统的正确率均未达到70%。MemOS 在 Medium 和 Long 上分别达到67.23% 和 64.44%,为两组最高值,但距离稳定可靠仍有明显空间。

对部分系统而言,长上下文带来的下降尤其突出。Mem0 的问答正确率从53.02% 降至 28.11%,同时,问答遗漏率从27.81% 升至 54.60%。这一变化与其上游记忆召回率的大幅下降相呼应。

打开网易新闻 查看精彩图片

图 3:六套记忆系统在六类题型上的回答准确率,分别展示其在 两个评测集上的表现。不同题型用于考察系统在不同记忆使用场景下的回答能力,以及长上下文对各类能力的影响。(论文图 5)

不同题型还揭示出能力差异:多数系统在识别未知信息或错误前提时表现相对较好,但面对多跳推理、动态更新和泛化应用,仍然存在明显短板。

最终答案是整条记忆处理过程的共同产物。想改善回答,需要同时检查事实是否被记下、变化是否被更新,以及检索出的信息能否被正确使用。

论文还随机抽取 10 位用户,使用 GPT-5.4-mini 替换主实验裁判进行复评。具体分数有所变化,但记忆系统的整体排名、主要表现趋势、提取覆盖与干扰抵抗之间的取舍,以及更新遗漏严重等核心发现保持一致。

4. 从「能记住」到「记得可靠」,还缺什么?

HaluMem 带来的价值,是让记忆系统的改进方向变得更具体。

如果问题在提取,就要同时检查信息覆盖和来源可信度;如果问题在更新,就要检查新旧记忆的关联,以及应做的修改是否真正完成;如果问题出现在问答,则需要结合上游记录与检索结果继续分析。

这也解释了为什么一项漂亮的单独指标还不够:高召回可能伴随虚假信息写入,低更新幻觉率可能伴随大量遗漏,而最终问答分数则可能遮住内部不同环节的失败。

当然,目前这项工作仍有未来可扩展的方向。当前数据围绕模拟用户的画像、事件和关系记忆展开,尚未全面覆盖工具、技能等其他记忆形态;不同系统开放的接口,也会影响内部操作的可观测程度。

但它已经提供了一种可复用的评测思路:把最终答案背后的记忆操作逐一拿出来核对,让「哪里出了错」成为可以测量的问题。

回到开头那个把新职位说错的助手。下一次,我们除了问「为什么又答错了」,还可以继续追问:这条信息最初记对了吗?升职之后改过了吗?回答时用的是哪一条记录?

当这些问题能够被逐一回答,AI 距离真正可靠的长期记忆,才有了更清楚的改进路径。