打开网易新闻 查看精彩图片

你有没有想过这样一件事:一个每天陪你聊天、帮你处理事情的AI助手,怎么记住你上周提到的那件烦心事?

大部分人以为答案很简单,无非是把聊天记录存起来,需要的时候翻出来看。但真实情况远比这复杂。当对话累积到几百轮、几千条记录之后,AI要在这堆信息里精准地找到跟当前问题相关的那一条,这件事本身就是个技术活。而更让人意外的是,现在主流的做法,是让AI自己再调用一次AI,去把这些记录压缩、总结、提炼成"记忆卡片",然后从卡片里检索。

这就带来一个隐藏很深的问题:每次生成记忆卡片,都要花钱、花时间。而且更麻烦的是,压缩的过程会丢东西。

这篇来自香港理工大学、西南财经大学和吉林大学联合团队的论文,提出了一个听起来有点反常识的方案:能不能让AI的记忆系统完全不用AI来运作?他们把这套方案叫做Zero-Mem,意思是"零token记忆操作"。这篇论文将于2026年发表,目前已挂在arXiv上。

记忆这件事,到底难在哪里

先说说现在流行的做法是什么样的。

市面上大多数AI记忆系统,比如Mem0、A-Mem、Zep这些,核心思路都是"生成式记忆"。什么意思呢,就是当AI跟你聊完一段对话之后,它会再调用一次语言模型,把这段对话总结成一条精简的"记忆条目",存进数据库。下次你问相关问题时,AI去检索的不是原始对话,而是这些被总结过的记忆条目。

这个思路乍一看很合理,压缩之后信息更紧凑,检索起来更快。但问题在于,压缩本身是有损耗的。

**如果两个人的名字很像,或者某个日期在总结过程中被模糊处理,原始细节就可能永远丢失了。**

这就好比你请一个秘书帮你整理会议记录。秘书为了效率,把两小时的会议浓缩成三行摘要。下次你想核实某个具体承诺是谁说的、什么时候说的,翻开这三行摘要,发现里面根本没写清楚,只写了"大家讨论了预算问题"。如果秘书当时把原始录音也留着,你还能翻回去核实;但如果只留了摘要,那些被压缩掉的细节就彻底消失了。而且这个秘书每次开会都要重新写一份摘要,每次都要收一次"服务费"。

另一种做法是干脆不压缩,把所有原始对话都存下来,用普通的关键词或语义相似度检索。这样信息不会丢,但问题是当历史记录足够长、足够杂的时候,同一个关键词可能命中好几个不相关的场景。比如你问"我上次说的那个项目进展如何",系统可能把三个月前提到的一个完全不同项目的对话也翻出来,因为字面上很像。

论文里给出了一组具体数据来说明当前方法的成本有多高。他们测试了三个代表性系统:SimpleMem、LightMem和GAM。在同样的测试条件下,GAM为了完成一次问答任务的记忆操作,总共消耗了2857万个token,平均每个查询要花1.85万个token,记忆操作总耗时超过9237秒。就算是号称"轻量级"的LightMem,也消耗了87万多个token。

**这意味着,每一次AI"想起"一件事,背后都在悄悄烧钱烧时间。**

Zero-Mem想问的问题是:这些开销,是不是根本没必要?

Zero-Mem的核心思路:留住原始证据,不生成中间产物

Zero-Mem最核心的设计理念,是彻底放弃"生成记忆摘要"这一步。

它不会让AI去总结、压缩、改写任何历史对话。所有的原始交互记录,包括用户说的话、AI的回复、工具调用的结果、时间戳、说话人身份,都原封不动地保留下来,作为"记录的唯一权威来源"。

> 溯源性:指信息可以追溯回它最初产生的地方,而不是经过多次转述之后的版本。

这个决定看起来简单,但背后其实是一个价值判断:与其让AI"猜"历史发生了什么(通过读摘要来猜),不如直接把原始证据摆在眼前,让检索系统精确地从中挑出相关的那一部分。

那么问题来了,如果不生成摘要,怎么保证检索足够精准、不会捞出一堆无关信息?

Zero-Mem的答案是,给原始记录建立两套互补的组织结构,一套负责"关系",一套负责"时间"。

### 第一套结构:实体上下文图

Zero-Mem会用一个不需要生成式AI的命名实体识别模型(比如spaCy这种开源工具)去扫描每一段对话,把里面提到的人名、地名、机构名这些实体都识别出来。

> 命名实体识别(NER):一种自动检测文本中人名、地名、机构名等专有名词的技术,不需要大型语言模型,普通的小模型就能完成。

然后,系统会把这些实体和它们出现的上下文段落连起来,形成一张图。如果某个实体在某段对话里出现的频率高,这条连接的权重就更大。相邻的对话段落之间也会建立连接,保证局部的连续性不会被打散。

这张图记录的是"观察到的共现关系",不是AI推断出来的语义关系。换句话说,它只是老老实实地记录"这个人名和那件事出现在同一段话里",不会去猜测"这个人可能和那件事有什么深层联系"。

这套图结构在检索的时候会怎么用呢?

当一个新问题进来,系统先把问题里提到的实体和图里已有的实体做匹配,找到最相似的那个,作为激活的起点。然后通过一种叫"个性化PageRank"的算法,让这个激活信号在图上扩散,越靠近激活起点、越相关的节点会得到越高的分数。

> 个性化PageRank:一种网络传播算法,原本用于网页排序,这里被用来衡量"哪些历史对话片段和当前问题最相关",通过让分数沿着图的连接不断传播来实现。

**这套图结构解决的核心问题是,让分散在不同时间、不同场合提到的同一个人或同一件事,能够被关联起来。**

打个比方,如果你问AI"我提到的那个叫小李的同事,后来项目做得怎么样了",而"小李"这个名字在三个月前的对话里出现过一次,上个月又出现过两次,分别谈了不同的进展。如果没有这张关系图,系统很可能只找到最近一次提到"小李"的对话,漏掉之前的关键信息。有了这张图,系统能顺着"小李"这个节点,把所有相关的对话片段都串起来看。

### 第二套结构:时间层级结构

光有关系图还不够,因为图结构本身不太在乎"先后顺序"和"上下文的连续性"。

Zero-Mem因此又搭了第二套结构,按照时间粒度把对话组织成四层:最细的是"轮次"(一次问一次答),然后是"窗口"(一小段连续对话),再往上是"事件"(一组围绕同一主题的窗口),最后是"局部片段"(某个轮次周围的邻近内容)。

> 时间层级结构:把历史对话按照从细到粗的时间粒度(轮次、窗口、事件、局部片段)组织起来的方式,用来保留对话发生的先后顺序和上下文连续性。

检索的时候,系统会先在"事件"这个粗粒度上找到相关的区域,再逐步细化到"窗口",最后落到具体的"轮次"。如果发现某个轮次需要更多上下文才能理解,系统会自动把它周围的局部片段也带上。

这套结构解决的是另一个问题:有些问题的答案不是靠"关联哪个实体"就能找到的,而是需要知道"这件事发生在什么时间段、什么会话里"。

举个例子,如果你问"我上周三跟AI聊的那件事后来怎么样了",这个问题的关键锚点是"上周三"这个时间点,而不是某个具体的人名或实体。这时候,时间层级结构就比关系图更管用。

**如果只有关系图没有时间结构,系统在处理这类"按时间定位"的问题时会非常吃力,因为图结构天生对时间顺序不敏感。**

反过来说,如果只有时间结构没有关系图,那些需要跨会话关联同一个实体的问题(比如"我提到的那个项目"横跨了好几次对话),就没法把分散的证据串起来。这也是为什么论文的消融实验显示,只用图检索或者只用时间检索,效果都会明显下降。具体来说,在HotpotQA测试里,完整模型的F1分数是72.07,只用图检索降到62.50,只用时间检索更是掉到54.88。这中间差了将近17个百分点,相当于每6个问题里,单一视角的方法就要比完整方案多答错1个。

怎么决定该用哪套结构:查询路由

有了两套互补的结构,接下来的问题是:面对一个具体问题,该优先用哪套?

Zero-Mem给每个查询建了一个轻量级的"画像",里面包含这个问题的主题、关键词、期望的答案类型、时间线索,以及可能的边界限制(比如"只查上个月的对话")。这些信息都是从问题本身和已有的元数据里提取出来的,完全不需要知道正确答案是什么。

> 查询画像:系统对当前问题的结构化理解,包括主题、关键词、答案类型、时间范围等要素,用来决定检索策略。

根据这个画像,系统会判断这个问题更偏向"关系型"还是"局部型"。如果是关系型,图检索的结果会被赋予更高的权重;如果是局部型,时间层级检索的结果权重更高。论文里用一个参数ρ(取值0.6)来控制这个权重分配,两套结构其实都会跑一遍,只是最后融合分数的时候,主视角占更大比重。

这个设计其实很像一个团队里的任务分配。假设你有两个同事,一个擅长梳理人际关系网络,另一个擅长按时间线整理事件进展。遇到问题的时候,你不会让两人各自单干互不干涉,而是先判断这个问题更需要哪种能力,让擅长的那个人主导,另一个人辅助补充。**如果不做这种区分,眉毛胡子一把抓,两套结构的优势反而会互相稀释。**

证据闭合:把碎片证据拼成完整拼图

光找到相关的候选证据还不够,因为很多问题的答案不是单独一条记录能回答的,而是需要把几条分散的证据拼在一起。

Zero-Mem在这一步引入了"证据闭合"的机制。它先把图检索和时间检索的结果做归一化处理,让两套打分体系可以放在同一个尺度上比较,然后按照前面提到的权重ρ融合成一个统一的分数。

融合之后得到的"主证据",还会被进一步补充。系统会从图结构里找一些"桥接"证据,也就是和主证据有关系连接但本身没被直接检索到的内容;也会从时间结构里找一些"邻近"证据,把主证据周围的对话轮次也带上。

这一步为什么重要?

因为很多复杂问题的答案,证据是分散在好几个地方的,单靠一次检索命中的那几条记录,往往缺了拼图里的某一块。证据闭合就是专门去补这些缺口。

打个比方,你去查一起案件的来龙去脉,直接搜到的可能只是案发现场的报告,但案件的动机可能记录在另一份完全不相关的文件里,你得靠"这个人和那个人有关系"这条线索,才能把两份文件联系起来。证据闭合做的就是这种补漏工作,如果没有这一步,很多需要跨记录关联的问题就会因为证据不全而答错。实验数据显示,去掉证据闭合这一步,F1分数从72.07降到67.90,少了4个多百分点。

确定性校准:不用AI也能查漏补缺

最后一步,是对拼好的证据集合和AI给出的答案做"校准"。

这里有个关键点:整个校准过程,不管是对证据的过滤排序,还是对最终答案的检查,全部都是"确定性"的规则判断,不需要再调用一次AI。

> 确定性校准:通过预先设定好的规则(比如"这条证据是否符合问题的时间范围""答案类型是否匹配")来筛选和修正结果,而不是依靠AI模型的判断。

具体来说,系统会先根据查询画像里的主题、时间、答案类型等信息,把不符合硬性约束的候选证据过滤掉,剩下的按相关性排序,组成最终喂给AI阅读器的证据集合。

到这一步,才轮到唯一一次真正调用大语言模型:让AI阅读器基于这些证据生成答案。

生成答案之后,系统还会做最后一道检查。如果问题的答案类型是可以用规则判断的(比如答案应该是一个具体的数字、日期,或者是从证据里能直接摘取的片段),系统会从证据里提取候选答案,和AI生成的答案做比对。如果AI给出的答案有证据支持、格式也对,就保留;如果不对,系统会用证据里更靠谱的候选项做替换,或者做一些提取式的精简处理。

**整个流程里,从证据组织、检索、到证据校准和答案校准,全程没有一次AI调用,只有最后生成答案这一步用到了大语言模型。**

这就是"零token记忆操作"这个说法的由来。

实验结果:省钱省时间,效果还更好

理论讲得再漂亮,最终还是要看效果。论文在两个基准测试集上做了验证。

第一个是LoCoMo,专门用来测试AI对长期多轮对话的记忆能力,题型分为单跳(直接查一个事实)、多跳(需要串联多条信息)、时间推理、开放域问答四类。

在GPT-4o-mini作为基础模型的设置下,Zero-Mem的平均F1得分是59.15,平均BLEU-1是52.96,都是所有对比方法里最高的。第二名是GAM,平均F1是53.75,Zero-Mem比它高出5.4个百分点。在Qwen2.5-14B的设置下,Zero-Mem同样拿到了所有题型、所有指标里的第一名。

第二个测试集是HotpotQA,专门考验在超长上下文(56K到448K token)里定位分散证据的能力。结果显示,Zero-Mem在所有上下文长度、所有基础模型的组合下,F1分数都是最高的,在最难的448K token设置下,平均比最强对手高出5.52个百分点。

| 方法 | F1得分 | BLEU-1 | 消耗token | 每查询耗时(秒) |

| SimpleMem | 48.02 | 41.68 | 14,096,246 | 5.43 |

| LightMem | 38.44 | 34.36 | 877,086 | 0.51 |

| GAM | 53.75 | 47.51 | 28,570,674 | 6.00 |

| **Zero-Mem** | **59.15** | **52.96** | **0** | **0.22** |

这张表格里最扎眼的一列,是Zero-Mem的token消耗直接是0。这不是四舍五入的0,是真的一个token都没花在记忆操作上。而效率方面,Zero-Mem每处理一个查询只需要0.22秒,比目前最快的LightMem(0.51秒)还要快57.6%。

需要澄清一点,"零token"不等于"零计算"。Zero-Mem依然要跑实体识别模型、要做向量检索、要执行PageRank这类算法,这些都需要计算资源,只是这些计算不经过大语言模型,不产生token费用。

**换句话说,省下来的不是计算量,而是那笔本可以避免的"AI调用税"。**

检索数量的影响:5条证据够不够用

论文还专门做了一个实验,看给AI阅读器提供多少条证据最合适。

结果显示,从只给1条证据提升到给5条,平均F1和BLEU-1有明显跃升,分别从52.59和46.79涨到59.15和52.96。继续加到10条,效果达到峰值,但再往上加到15条、20条,效果基本不再提升,甚至略有波动。

不同题型的"胃口"还不太一样。单跳问题只需要少量证据就够了,而多跳、时间推理、开放域这类需要综合多方面信息的问题,更依赖充足的证据覆盖面。

论文最终选择了给5条证据作为主实验配置,主要是为了和其他基线方法保持一致的对比条件。用5条相比用10条,只损失了0.65个F1点和0.83个BLEU-1点,但检索的候选数量减了一半,性价比更高。

写在后面

读完这篇论文,最让我意外的一点是,大家一直默认"记忆系统要智能,就得让AI参与整理",但Zero-Mem用实打实的数据证明,这个默认假设本身可能是错的。GPT-4o-mini设置下平均F1能到59.15,比用了大量LLM调用的GAM(53.75)还高,而且是在完全不消耗记忆操作token的前提下做到的。这说明"智能"未必要靠生成式模型来实现,一套设计得当的非生成式结构,配合确定性规则,可能比"让AI自己去总结再自己去理解"更靠谱。

还有一个细节值得单独说一下:论文里提到,生成式摘要会"blur"(模糊)一些关键的时间更新和主体信息,这在处理时间推理类问题时特别致命。这也解释了为什么Zero-Mem在时间推理题型上的领先幅度格外大(GPT-4o-mini设置下F1从59.45涨到61.97,Qwen2.5-14B设置下从51.52涨到58.34)。压缩这件事,代价往往出现在你最不注意的细节里。

如果记忆系统真的可以不依赖生成式AI来运作,那接下来的问题是:检索系统之外,还有哪些环节其实也是被生成式AI"绑架"的,是不是也存在同样便宜且更靠谱的替代方案?

Q&A

Q1:Zero-Mem是什么?

A:Zero-Mem是港理工、西南财大等团队联合提出的一种AI智能体记忆系统,它的核心特点是除了最后回答问题这一步,记忆的组织、检索、校准全过程都不调用大语言模型,不消耗任何LLM token。

Q2:Zero-Mem和Mem0、GAM这些记忆系统比,效果怎么样?

A:在LoCoMo和HotpotQA两个基准测试上,Zero-Mem的准确率(F1、BLEU-1)都超过了Mem0、GAM、SimpleMem等主流方法,同时记忆操作耗时比最快的对比方法还少57.6%,token消耗直接为零。

Q3:Zero-Mem为什么不用AI生成记忆摘要,而是保留原始对话?

A:因为生成摘要的过程会造成信息损耗,比如模糊时间细节、合并相似主体,这对需要精确追溯的问答任务是致命的。Zero-Mem保留原始记录,通过实体关系图和时间层级结构做非生成式的精准检索,既避免信息丢失,也省去了重复调用AI的成本。