打开网易新闻 查看精彩图片

AI 如今要走向实际应用,能力已经不是最关键的掣肘,记忆才是。

以 AI 编程为例,主流工具的用户社区里,最常见的抱怨就是模型自动“压缩”引发的信息损伤。开发者花了两个小时才和 AI 助手建立起的默契,很可能在下一轮对话中就全盘崩坏。最后 Token 烧掉不少,工作效率反而被拖慢了。

随着大模型的推理能力不断升级、工具生态日益成熟,它越深入地嵌入我们的日常工作,一个过去少有人在意的课题反而变得越重要:AI 到底能不能拥有类似人脑的“记忆”?

行业如今正在向答案靠近。8 月 12 日,牛津大学、清华大学、北京大学等近 30 所机构学术团队联合发起的“记忆之巅排行榜”(AML)正式揭晓首期榜单。首期评测吸引 136 个团队参赛,官网点击量突破 20 万,上线后迅速跻身 Hugging Face 每周热门榜单前三。

(来源:Hugging Face)
打开网易新闻 查看精彩图片
(来源:Hugging Face)

在最受关注的商业产品文本赛道,综合排名第一的系统来自一家成立仅五个月的深圳公司,MemoraX AI(忆纪元)。它的总得分为 58.0,在文本记忆的全部七个能力维度上都居于首位。对照来看,在海外开发者社区拥有较高热度的开源项目 Mem0、MemPalace、Supermemory 则分别位列第 8、9、14 名。

当记忆逐渐成为 AI 的必修课,谁能交出最令用户满意的答卷?

打开网易新闻 查看精彩图片

记忆正在成为 AI 基础设施的独立环节

大模型的上下文窗口已经达到数百万 Token 量级,能装下更多对话,却依然难以真正记住用户的喜好和习惯。类似的问题也出现在多标签页切换、跨会话恢复等场景中:随着窗口扩大,AI 反而不那么好用了。

原因在于,把海量信息喂给模型后,AI 更容易在冗长且充满噪声的内容中产生幻觉。甚至反复踩坑、将用户的指令抛之脑后。要想让 AI 拥有长期记忆,就必须从底层让它想清楚“哪些应该记、哪些可以忘”,以及如何在合适的时机调用正确的记忆。

进入 2026 年,AI 应用开始从“单次问答”走向“长期陪伴”,在各个场景里,记忆能力都在成为越来越紧迫的优先事项。

具体来看,《麻省理工科技评论》2026 年“十大突破性技术”榜单(TR10)中,“AI 陪伴”与“生成式编码”分别占据一席。

前者要求 AI 在无数互动中稳定理解使用者的情感、过往偏好与习惯,后者同样要求 AI 能持续跟踪项目架构、代码风格与开发上下文,在长达数天乃至数月的项目周期中顺利辅助用户完成任务。

如果说这两项技术代表了 AI 走向长期协作的应用前台,Agent Memory 就是支撑这种协作得以持续的底层基础设施。

企业部署的 AI 应用与多位员工分别交互,从中沉淀业务规则。但行业调研显示,上下文丢失等记忆缺陷是企业 AI 应用未能规模化落地的主因之一。可穿戴设备、智能家居和具身智能等终端则将记忆的重要性推至决定产品生死的地位:没人想长期使用一款随时会遗忘用户习惯的 AI 产品。

在记忆环节,学术与开源社区已有进展。4 月,前 OpenAI 创始成员、现 Anthropic 预训练团队成员安德烈·卡帕西(Andrej Karpathy)在 GitHub 发布了一份名为“LLM Wiki”的构想文档,反思现有检索式记忆范式,并呼吁模型行业构建不断累积、可被自身更新的知识底座。主攻模型记忆的 Mem0,GitHub 已突破六万星标,是过去一年增长最快的 AI 底层开源项目之一。

云基础设施厂商也意识到了这一问题,陆续为其智能体开发平台装上记忆模块:AWS 的 Bedrock AgentCore 中,支持短期会话与跨会话长期记忆的 Memory 成为核心组件;微软 Azure 也开放了 AI Foundry Memory 模块。

行业整体动向共同指向一个趋势,记忆正从附属功能升级为 AI 的必备基础设施。不过,解决记忆问题的技术不止一种,谁的路线能最终跑通?

打开网易新闻 查看精彩图片

从“外挂检索”到“内生记忆”:三代技术路线的演进

回顾过去两年多的行业实践,可以按技术深度将其大致划分为三代。

第一代是向量检索式记忆,即当下最主流的检索增强生成(RAG)路线。技术原理在于,将历史信息切分成小块,分别转成向量后存入外挂数据库;对话触发后,系统按相似度检索出若干片段,拼接进提示词供模型参考。

这条路线的最大优势是工程门槛低、生态成熟,LangChain 等主流智能体框架都提供开箱即用的实现。局限也同样明显:该路线很难实现跨场景迁移,它的本质是“查字典”,模型无法真正理解片段之间的关系,不会主动遗忘过时的偏好,也不会根据新交互来更新判断。

第二代是结构化记忆,包括引入知识图谱、分层存储或“记忆操作系统”等架构。该路线将向量条目按实体、关系、时间等维度组织起来,与前代相比多了关系建模能力,也能对不同优先级的记忆做分层管理。

但它并未跳出“外挂”的框架,只是给 AI 搭建了更聪明的资料库:存储依然是静态的,检索依然是被动的,记忆系统依然不会从交互中自主进化。

第三代是内生记忆,这一路线彻底放弃了向量检索,试图让记忆成为模型的原生能力:通过强化学习进行端到端训练,让模型在前期训练和后续使用中学会记忆的写入、压缩、遗忘与调用

三代之间的差异,本质上是“存储与检索”到“决策与学习”的范式迁移。前两代把记忆视为一个信息管理问题;第三代把记忆视为一个序列决策问题:AI 记忆能力的升级,取决于其能否被建模为一个可训练、可评估、可优化的学习系统。

落到评测层面,AML 首期榜单中,第一名与后位系统间超过十分的差距,很大程度上正源于不同模型在不同路径上演化的进度。

打开网易新闻 查看精彩图片

第一名背后,AI 如何学会“管理记忆”?

AML 将参评系统的参与限定在 Add(写入和更新记忆)与 Search(检索记忆),最终的 Answer(基于检索结果生成回答)和 Eval(评分)则由平台统一完成,从而在一定程度上减少回答模型、Prompt 和评分规则不同带来的干扰。

从整张商业榜单来看,各记忆模型公司的能力结构呈现出显著的差异与分化。其中,MemOS 在事实召回、多跳推理、时间推理和记忆治理上表现较好,这与其强调结构化、可编辑与自演化的技术路线相呼应。

网易 NTES-MEMORY-SMART 个性化能力高达 57 分,在用户意图与偏好理解方面具有优势。

综合评分排名靠前的 TencentDB Agent Memory、Mem0、SuperMemory 等框架则各有优劣,总体而言,高阶记忆管理能力还有提升空间。

而本次拿下榜单第一的 MemoraX ,其在事实召回、多跳组合、时间与事件、记忆治理、个性化、规则执行、安全与隐私七个维度中都取得最高分。

图 | 榜单前三名不同维度得分对比(来源:AML)
打开网易新闻 查看精彩图片
图 | 榜单前三名不同维度得分对比(来源:AML)

基于此,一个更值得深入讨论的问题是,这位“优等生”为何不偏科?原因在于,MemoraX 已经来到 AI 记忆路线的第三层:模型原生。实现了从强化学习、大模型后训练到记忆策略学习,再到长期记忆评测与工程化的技术链条闭环。围绕这一思路,MemoraX 目前形成三层技术体系。

第一层是可学习记忆策略引擎,传统记忆方案主要依靠人工规则、Prompt 或固定流程实现。但 MemoraX 希望借助强化学习,让模型在长期交互中自主完成记忆管理决策。

第二层是记忆基模。与直接调用通用大模型处理所有任务不同,MemoraX 将其定位为专门针对长期记忆任务训练的模型,处理超长上下文、时间关系以及记忆压缩等问题。

第三层则是自演进 Agent Harness,将实际应用产生的交互和反馈重新引入系统,让前面的记忆策略能够继续迭代。

总体而言,MemoraX 真正想改变的是模型记忆的底层逻辑:不只是堆信息量,更关键的是让 AI 自己决定“什么值得记”。

支撑这套技术体系的,是团队在产业落地与算法创新两方面的长期积累。MemoraX AI 的核心成员一部分曾是华为、阿里、腾讯等企业的大模型研发与 Agent 团队技术负责人,合作成果曾在芯片设计、游戏AI、推荐搜索等工业级场景大规模落地。

另一部分则是国内强化学习领域的头部研究力量,兼具学术与产业化经验。以团队的代表性工作 ReMix(ICLR 2026)为例,它支持在后训练中安全复用历史数据,解决了强化学习的数据浪费问题。在部分设置下,训练数据效率可提升 30 至 450 倍。这种能力实际上就可被迁移至模型的高阶记忆中。

围绕大模型后训练、Test-Time Scaling 等方向,团队与多所高校合作的 10 篇论文已被 ICML 2026 录用。相关工作曾获中国电子学会自然科学奖一等奖、中国图像图形学会科技进步奖一等奖。

AML 不是 MemoraX 交出的第一份考卷。更早之前,MemoraX 已在几个不同类型的记忆基准取得亮眼成绩:在南京大学与上海 AI Lab 联合发布的 LoCoMo-Refined 基准上拿到 82.65 分、领先第二名 30%;在与牛津大学联合开源的剧本记忆基准 ScriptMem 上正确率 60.3%、领先第二名 40%;在编程领域的 SWE-context-bench 上任务解决率 45%、领先第二名 50%。

如今,为推进 Agent Memory 愿景落地,MemoraX 正在快速推进商业化。2026 年 4 月,公司完成千万美元种子轮融资,5 月完成数千万元人民币种子+轮,8 月又宣布完成数亿元种子++轮。据悉,公司还与华为云签署战略合作,目前是后者合作厂商中唯一聚焦长期记忆的企业。

当然,Benchmark 测试的是特定规则和数据集下的表现,真正的验证必须在生产环境中进行。

应用场景方面,MemoraX 正在覆盖 Coding Agent、医疗健康、智能家居、智能穿戴和具身智能等方向。在AI Coding 领域,其产品试图让 Codex、Claude Code 等 Agent 持续理解项目上下文和历史开发经验。在慢病管理中,则需要持续理解用户状态;进入家庭和智能终端后,需要沉淀家庭成员习惯与设备偏好。

在产品路径上,公司将进入企业知识管理、智能客服等 B 端领域,同时在个性化智能助手以及交互式产品等 C 端应用也有布局。

打开网易新闻 查看精彩图片

AI 记忆,距离真正的基础设施还有多远?

长期来看,AML 榜单上展现出的性能,究竟能否在数月乃至数年的实际运行中维持,是整个 AI Memory 赛道需要面对的考验。

目前 Agent Memory 最成熟的评测仍集中在文本,MemoraX 也已经在图像记忆相关 Benchmark 上进行验证。但智能眼镜、耳机、家庭机器人等真正需要长期记忆的设备,收集的信息往往是包括视频、语音甚至高度不确定的现实环境等多种模态。

如何为时间、空间序列下的海量内容搭建稳定可用的记忆决策框架,将成为模型原生记忆领域最大的技术挑战之一。

而榜单覆盖的维度再全面,也只能衡量记忆系统在特定数据集与评测规则下的能力切片。进入生产环境后,平台面对的是更复杂的现实变量:成本、延迟、隐私权限、记忆存储时长,每一项都直接关乎用户信任和商业效益。更关键的是,作为一个长程系统,AI 记忆一旦出错,后果将随时间不断放大,记忆系统的迭代与纠错能力有时或许比“记住”更重要。

推理能力的竞赛已经白热化,而一个记不住上下文的 AI,终究只是“聪明的陌生人”。先让 AI 变成“靠谱老搭档”的公司,才有望在 AI 时代的下半场掌握先发优势。

参考资料:

https://agentmemoryleaderboard.ai/leaderboard/industry/textual

https://github.com/mem0ai/mem0