2026 年,大模型能力快速跃迁,AI Agent 正在从对话交互工具,走向能够自主规划任务、调用工具、持续运行数小时甚至数天的智能体。但在这个过程中,一个越来越明显的问题正在暴露:Agent 依然缺少对人的持续理解能力。
这背后,正是 AI 记忆(AI Memory)这一层能力还不够强。
对于人类而言,记忆并不是简单保存过去发生过什么,而是一个持续筛选、重构和理解经历的过程:哪些事情重要,哪些信息值得保留,什么时候应该想起某段经历,以及如何结合当前情境作出判断。
我们希望 AI 记住自己的工作习惯,理解自己的专业领域,知道过去做过哪些决定,甚至能够理解一句话背后的情绪和意图。事实上,当前 Agent 面临的很多问题,例如长任务执行失败、跨会话能力不足、自主性有限,背后都指向同一个能力的缺失:长期记忆能力。
这正是张源和她的团队试图探索的问题,2025 年她创办了丘脑智能并担任 CEO。张源毕业于北京大学,是电子与经济双背景,曾在创投行业工作,并先后参与自动驾驶、具身智能等前沿赛道创业。
在过去的产业经历中,她持续关注 AI 技术从实验室走向真实应用过程中遇到的问题,也积累了对技术商业化路径的理解。正是在这一过程中,她逐渐意识到 AI 记忆,可能正是连接技术模型能力与用户价值之间缺失的关键一层。
在张源看来,AI 记忆的核心并不是信息的存储,真正困难的问题是:什么应该被记住,什么应该被遗忘,什么时候应该调用哪一段记忆,如何让 AI 形成对一个人的长期理解。
也正因为如此,张源团队开始探索一种更接近人类记忆机制的架构,他们希望让 AI 不只是保存信息,而是能够对信息进行编码、整合和更新。未来 AI 的竞争不会只发生在模型参数规模上,基础模型可能会越来越强,也可能会有多个模型长期共存,但真正决定 AI 能否成为长期智能体的,是它是否拥有围绕用户持续积累的数据闭环。
这一判断也正在获得资本市场的关注。近日,丘脑智能获得数千万元种子轮融资,由一线人民币基金及产业资本联合投资,用于推进 AI 记忆技术研发和产业化落地。
以下是我们的对话:
AI 记忆正成为连接模型与人的关键基础中间层
DeepTech:是什么时候开始意识到 AI 记忆是一个必须解决的重要问题?技术路线是如何演进的?
张源:最早是在 2025 年春节前后 DeepSeek 爆火之后,我开始明显感受到 AI 使用中的一个痛点,与 AI 的对话中很多事情需要重新解释和重复沟通,模型并不能真正理解用户过去的上下文。
虽然当时还没有明确叫 AI 记忆,更多被称为上下文窗口等概念,但我意识到这里可能存在巨大的商业机会。随后我们调研了国内外市场,发现国内几乎没有团队专门解决 AI 记忆的问题,而海外虽然有一些探索,但整体仍处于早期阶段。
更重要的是,我认为未来 AI 的能力上限会非常高,从基础模型能力到真正可用的 AI 应用之间,缺少一个关键的层级,而这个层由 AI 系统复杂度和个性化数据闭环构成。其中, AI 记忆正是连接用户与 AI、形成个性化数据闭环的关键基础设施。未来即使多个基础模型长期共存,不同模型之间存在差异,用户在不同场景切换模型时,依然会面临“记忆孤岛”的问题,因此 AI 记忆会成为长期存在的重要赛道。
我们最开始是从 RAG、GraphRAG 等技术路线切入,团队早期也取得了一些 benchmark 上的突破,但我们没有继续走纯学术路线,而是开始进入真实客户场景进行测试。
通过与二十多家客户交流和测试,我们发现 benchmark 分数提升,并不一定能够转化为真实商业价值。例如从 30 分提升到 80 分,用户感知非常明显,但当模型从 85 分提升到 90 分时,普通用户已经很难感受到差异,也不会因此付费。
原因在于,学术 benchmark 与真实应用场景存在差距,同时模型能力达到一定临界点后,继续提升性能带来的用户价值有限。因此,我们重新思考技术路线,从单纯追求 benchmark 转向解决真实产品需求。最终,我们参考脑科学中人类海马体的记忆机制,设计了一套更轻量化、更接近人类记忆方式的 AI 记忆架构。
通过大量客户测试,我们发现企业和用户真正关注的是产品体验上的实际提升。客户最关注的两个指标:第一是延迟,能否降低几百毫秒的响应时间,对他们来说就是非常明显的产品竞争力;第二是成本,技术不仅提升效果,同时还能降低整体成本,客户才愿意为此付费。
因此,我们认为 AI 记忆的核心方向不是无限堆叠复杂模型,而是在保证记忆能力的基础上,实现更低延迟、更低成本、更轻量化的架构。基于这一判断,我们开始进行架构迭代,并与香港中文大学相关实验室开展合作,希望结合脑科学等领域的研究成果,探索更接近人类记忆机制的新型 AI 记忆架构。
DeepTech:速度和成本这两方面能够达到什么水平?
张源:目前我们的响应速度稳定在 200~400 毫秒区间。在短对话场景下,这种速度优势可能并不明显,但当用户的长期记忆不断累积,数据规模越来越大时,传统 GraphRAG 等方案会面临明显的性能瓶颈。因为随着记忆内容增加,知识图谱的复杂度会快速增长,检索和计算成本也会随之提升,导致延迟不断增加。
我们的架构优势在于,即使用户的记忆持续增长,响应速度依然能够保持稳定在 200~400 毫秒范围内,不会因为记忆规模扩大而出现明显性能下降。我们希望解决的就是 AI 长期记忆过程中越用越慢的问题。
目前我们已经商业化的产品,将 AI 记忆能力封装成 ADK 和 API,对外提供记忆能力支持。在实际商业应用中,我们能够在大模型输入环节减少约 40% 的 Token 消耗。因为传统方案往往需要将大量历史上下文输入给大模型,而我们可以帮助模型更高效地提取和调用关键信息,减少无效上下文。
此外,我们还有一些尚未商业化的正在实验室验证中的技术路线,最高能够达到两个数量级的节省,将 Token 消耗降低到原来的几个百分点水平。
DeepTech:很多人认为 AI 记忆的出现,是因为当前大模型能力还不够强。如果未来模型能力继续提升, AI 记忆是否会被模型本身取代?
张源:我认为 AI 记忆的核心并不在于“存储”,而在于“决策”。简单地把信息保存下来,其实 Markdown 文件或者数据库都可以解决,真正困难的问题是:什么信息值得被记住,什么信息应该被遗忘;什么时候应该调用记忆,应该调用哪些记忆,调用多少信息,以及如何在性能、成本和延迟之间进行权衡。
因此,AI 记忆并不是一个简单的信息仓库,而是一个围绕用户持续运行的决策系统。它需要跨模态、跨对话、跨时间周期地理解用户,把真正有价值的上下文和证据提取出来,而不是简单地进行全量搜索或模糊匹配。
未来随着基础模型能力增强,上下文窗口不断扩大,推理速度提升,基础模型厂商可能也会在自己的模型体系内加入记忆能力。但我们认为,记忆层依然会长期存在,因为未来不会只有一个基础模型统治所有场景,而是多个模型长期共存。
不同模型由于训练数据、模型结构和能力侧重点不同,会各自擅长不同任务,用户仍然需要在不同模型之间切换。真正限制 AI 能力上限的,是模型是否拥有用户完整的知识体系、行业经验、生活背景和个人历史信息。
因此,我们认为未来记忆一定是以用户为中心的,它不会绑定某一个基础模型,而是跟随用户本身存在。无论用户调用哪个模型,都能够访问自己的个性化数据和长期记忆,只有这样,基础模型的能力才能真正被释放到上限。
AI 记忆正从信息检索走向智能决策
DeepTech:当前 AI Agent 发展面临长任务执行、跨会话记忆和主动智能等挑战,对于 AI Agent 需要怎样的记忆能力?刚刚您提到的“决策”和“召回”问题如何解决?
张源:Markdown 文件虽然解决了记忆存储的问题,但没有解决记忆最核心的“决策”问题——什么信息应该被记住、什么时候需要调用、应该调用哪些内容。当文件规模扩大后,每次检索都会带来较高延迟,同时消耗大量 Token,也无法很好支持多模态场景。
此外,也有一些团队尝试通过强化学习训练记忆层。但我们认为这种路径存在几个问题。
首先,从商业角度看,强化学习训练需要大量算力投入,对于创业公司而言投入产出比并不一定合理。
其次,记忆和基础模型的目标本质不同,基础模型服务的是人类公共知识,而记忆服务的是某一个具体用户的个人历史信息。
最后,强化学习的方式除了成本之外,我觉得还有数据因素,这是“先有鸡还是先有蛋的问题”,现在记忆是一个很新的领域,领域内的数据还不够多。
如果记忆出现错误,影响可能比基础模型幻觉更加严重,基础模型回答错误的问题,可能只是一次错误交互,但记忆如果错误记录或编造用户经历,会直接影响长期认知。所以我们认为,记忆应该和基础模型解耦。未来基础模型会持续进化,但记忆层应该成为一个独立存在的用户级基础设施,解决不同模型之间的记忆孤岛问题。
AI 记忆的核心难点在于,同一件事情对于不同的人,其重要程度完全不同。例如,同样参加一次饭局,对于一个人来说,重要的是“吃了什么菜”;对于另一个人来说,重要的是“聊了什么事情”。两个人经历的是同一事件,但未来需要召回的信息完全不同。
因此,AI 记忆的决策不能只依靠固定规则,而需要建立在对用户长期画像和真实数据反馈的基础上。我们目前通过真实用户数据,对不同类型的人进行归类和标签提炼,理解不同用户关注信息的差异。同时,我们也在尝试引入更智能的模型能力,帮助 AI 记忆在决策阶段判断哪些信息更值得保存。
“召回”也是同样的问题。同一个事件,不同用户在不同场景下召回内容也应该不同。比如同样的饭局,在和朋友聊天时,可能需要回忆“当时吃了什么”;在工作交流时,可能需要回忆“当时讨论了什么事情”。AI 记忆真正需要解决的不是简单找到相关信息,而是理解用户身份、目标和使用场景,决定什么信息在什么时候最有价值。
因此,AI 记忆的核心能力需要转向理解用户,并主动决策什么信息应该被调用。这也是 AI 记忆区别于传统知识库的关键。
DeepTech:你们是否会采用类似 AI Dreaming(梦境机制)的方式,对用户长期记忆进行整理、抽象和压缩?具体是如何实现的?
张源:我们内部称这个过程为“异步更新”,就是指在用户非使用的时间段,对积累下来的历史信息进行整理和重构。
但这个过程并不是简单地对所有历史内容进行总结,而是参考人类记忆形成机制,对原始信息进行多层处理。首先,我们会对原始信息进行事件识别和过滤,判断哪些信息是关键内容,哪些属于噪声并进行剔除;随后对保留下来的信息进行时间和空间上的对齐,把分散的信息组织成具有上下文关系的事件。
在此基础上,我们参考人类海马体对记忆编码的方式,将原始信息转化为带有丰富上下文的单元。这些单元并不是简单压缩后的摘要,而是保留了一部分原始信息和证据链,确保未来召回时能够追溯来源。
之后,将不同事件、不同场景进行连接。随着时间推移,系统会不断丰富事件脉络,扩展场景边界,逐渐形成用户的认知地图和场景地图。最终,当用户提出问题时,系统不是简单搜索关键词,而是能够基于用户当前场景,判断哪些记忆真正相关,并以更符合用户需求的方式进行召回。
DeepTech:目前 AI 记忆的架构存在可读(如 Markdown 文件)和不可读(如向量存储)两种路线,这两种方式应该如何选择?
张源:我认为两种架构并不存在绝对的优劣,而是取决于具体应用场景。可读和不可读的记忆本质上是在解决不同的问题。如果应用场景是文档整理、知识管理等任务,那么可读形式可能更有优势。
因为这类场景的核心目标不是追求最低延迟或最低成本,而是希望把过去的文件和资料进行整理、归纳和理解,需要人能够查看、修改和验证,因此可读的结构化存储更符合需求。但对于实时对话、个人 AI 助理等场景,用户更关注最终结果,而不是 AI 记忆内部如何组织和处理信息。
这类场景对实时性、成本和效率要求更高,因此采用向量表征或者更加不可读的存储方式可能更合适,因为它能够更快速地完成信息匹配和调用。
AI 记忆仍需突破哪些技术挑战?
DeepTech:接下来聊几个技术还存在的挑战。目前 Agent 在长期运行过程中,经常出现自我一致性不足的问题,同时 AI 模型本身一定会存在幻觉问题,那么 AI 记忆如何保证记忆的准确性,并降低幻觉带来的影响?
张源:我认为这是一个客观存在的问题,而且它并不是单靠 AI 记忆就能够解决的。Agent 的自我一致性依赖多个因素,包括 AI 记忆的丰富程度、信息召回的准确性、AI 系统整体复杂度,以及基础模型本身的能力。
具体来说,需要综合考虑系统架构是否与应用场景匹配, AI 记忆是否能够准确判断什么时候该记、什么时候不该记,什么时候应该召回、召回哪些信息,以及这些信息是否能够跨模态、跨会话、跨时间被正确关联。
幻觉问题也是 AI 记忆领域非常关键的问题。传统的一些方案通常会直接对用户历史信息进行摘要、压缩或者抽取,但这种方式容易产生幻觉,因为在压缩过程中,很多原始信息和证据链可能在第一天就已经丢失了。我们的思路不同。
我们不会一开始就对原始信息进行简单摘要,而是先对原始内容进行事件识别,然后进行编码、整合和过滤。在这个过程中,我们会保留一部分原始的证据链,将信息转化为带有结构化关系的记忆单元。
这样做的好处是,未来 AI 基于记忆进行回答时,不只是依赖一个抽象后的结论,而是能够回溯到原始证据。因此,AI 记忆输出的内容具备一定程度的可审计性,用户可以判断这个记忆是否真实,降低幻觉风险。
此外,我们还设计了置信度机制。当系统判断某条记忆的可信度不足,或者不同记忆之间存在冲突时,不会强行生成答案,而是倾向于主动询问用户,通过人与 AI 的交互完成确认。通过证据链、置信度判断以及人类反馈闭环,可以进一步提高 AI 记忆的准确性。
DeepTech:人类交流中包含大量情感、意图和隐含信息,而当前 AI 主要依赖文本理解,AI 记忆如何理解和记录这些非显性信息?
张源:这是 AI 记忆领域非常重要但目前还没有完全解决的问题。人类交流并不仅仅是字面信息,很多时候一句话背后包含情绪、意图、态度和上下文。如果只依靠纯文本理解,这类信息确实非常难捕捉,因为很多表达本身就存在非标准答案。
未来多模态能力的发展会帮助解决这个问题。虽然加入语音、图片、视频等更多模态,虽然整体理解难度会增加,但对于情感和意图判断来说,会获得更多信息来源,例如语气、停顿、沉默、表情、动作等,都可能成为判断用户真实状态的重要依据。
比如在陪伴机器人场景中,用户说话时的语气变化、叹气、长时间停顿,甚至表情和动作,都可能反映用户当前的情绪和意图。这也是我们目前更多关注 AI 硬件场景的重要原因之一,因为硬件能够持续获取更加丰富的多模态反馈,同时也有真实用户使用数据进行验证。
除此之外,我们实验室也在探索如何从文本和交互数据中提取用户隐含偏好,希望通过微调小模型,将输入信息转化为携带隐式偏好信息的高维向量。这些隐式偏好本质上就是用户的情感和意图信息。目前实验结果比较积极,后续也计划进一步发表相关研究。
DeepTech:人的记忆似乎没有容量限制,但 AI 记忆有容量上限,未来如何解决长期记忆问题?此外,人类虽然会遗忘,但很多时候通过某个线索就能重新回忆起来,当前 AI 记忆似乎是永久遗忘机制?
张源:其实人类记忆本身也不是无限的,只是人类通过不断更新、遗忘和重构,让记忆系统保持长期有效。比如很多人可以清晰记得高中时期某些重要事件、老师、考试成绩,但可能已经忘记了某一天午饭吃了什么,或者某个同学的名字。人类并不是保存了所有信息,而是根据事件的重要程度、提及频率、情感价值和关联关系,对记忆进行动态筛选。
AI 记忆也需要类似机制。核心不是无限扩充存储容量,而是建立有效的遗忘和更新机制。对于低价值、低频率、弱关联的信息,可以逐渐降低权重甚至遗忘;对于高价值、高影响的信息,则长期保留。
现在很多 AI 记忆方案采用的是永久遗忘机制,一旦信息被删除,就很难再次恢复。但从人类记忆机制来看,遗忘并不一定意味着完全消失,而可能只是降低访问优先级。未来 AI 记忆可以考虑类似“冷热分区”的架构:高频、高价值的信息保持快速访问;低频信息进入低成本存储区域,需要特定线索触发时再恢复。
当然,是否需要支持这种长期记忆恢复能力,最终取决于真实需求,如果用户和企业愿意为这种能力付费,并且它在生产生活中具有足够高的价值,那么行业一定会进一步优化架构,实现更复杂的长期记忆机制。本质上,这是一个技术选择和商业价值之间的权衡,而不是单纯的技术难题。
从技术能力到产业落地,AI 记忆如何找到应用场景
DeepTech:接下来我们最后再聊几个产业落地的问题。您目前更多地服务于 B 端用户还是 C 端用户?
张源:我认为阶段性的商业策略,必须服务于阶段性的战略目标。我们是较早布局多模态长记忆方向的团队,也较早获得了真实用户数据反馈和数据闭环。目前在技术上已经建立了一定优势,因此现阶段最重要的事情,是获取更多真实场景的数据,不断完善数据闭环,构建未来更难被复制的竞争壁垒。
基于这个目标,我们现阶段会更关注拥有大量用户和快速出货能力的 AI 硬件客户。因为 AI 硬件天然连接大量 C 端终端用户,可以帮助我们快速获得真实用户交互数据,包括用户行为、偏好、使用场景等。这些数据对于 AI 记忆技术持续优化非常重要。
因此,我们会选择与有规模、有用户量的 AI 硬件厂商合作,为他们提供记忆能力。通过产业合作,一方面帮助硬件产品提升智能化体验,另一方面也通过真实用户反馈持续训练和优化我们的记忆系统。未来,随着数据闭环不断完善,这些真实场景中的用户数据和反馈,将成为我们区别于其他 AI 记忆方案的重要壁垒。
DeepTech:在产业落地过程中,客户更倾向于自研 AI 记忆能力,还是采购成熟方案?你们如何看待这两种模式?
张源:这是一个非常现实的问题,本质上是企业在效率、安全和战略自主之间进行权衡。不同类型的客户,选择会有所不同。
对于头部企业来说,他们拥有充足的资金、研发能力和技术资源,因此确实有能力在自研和采用第三方方案之间进行选择。这类企业更关注的是阶段性的战略目标,是希望快速抓住市场窗口期,还是希望长期投入建设自己的技术能力。
对于中小型公司和创业公司而言,他们通常没有投入大量资金进行底层研发的能力,也没有足够的时间窗口从零搭建 AI 记忆能力。对于他们而言,AI 记忆不是一个可选项,而是必须具备的基础能力。
因为未来 AI 产品的竞争中,记忆会直接影响用户粘性。如果一个产品没有持续理解用户、积累用户数据的能力,而竞争对手已经具备,那么它很可能会逐渐失去竞争力。自研 AI 记忆的成本和周期更难承担,他们更需要借助成熟方案快速构建产品能力。
DeepTech:除了 AI 硬件之外,哪些行业会成为 AI 记忆的重要落地场景?不同场景对 AI 记忆的需求有什么特点?
张源:我认为 Memory 最适合的场景,是那些具备高频人机交互、长期交互和强个性化需求的领域。
客服是一个非常典型的场景。目前很多智能客服主要依赖 RAG 和固定话术模板,存在两个明显问题,第一是准确性有限,很多回答比较机械,无法真正理解用户历史背景;第二是延迟较高,用户体验不好。因为客服系统并没有真正理解和记住此前的交流内容,如果加入记忆能力,客服可以持续理解用户上下文,提升连续对话体验。
教育也是一个非常好的方向。我们已经有一些教育类硬件客户,这类产品天然需要长期陪伴式交互。例如 AI 学习机、教育助手等,需要持续理解学生的学习习惯、知识掌握情况和个性化需求。
总体来看,越是需要长期交互、越依赖用户个性化理解的场景,对记忆能力的需求越强,AI 记忆的价值不只是保存历史信息,而是在长期互动过程中不断建立对用户的理解。
DeepTech:面对不同行业客户,AI 记忆产品应该采用定制化开发模式,还是标准化产品模式?
张源:我们的方向一定是最大程度实现标准化,而不是为每个客户进行深度定制开发。如果每进入一个行业都进行定制化开发,虽然能够满足单个客户需求,但长期来看会限制产品规模化能力。因此,我们希望通过标准化 API 和 ADK的方式,让记忆能力能够快速被不同类型客户调用。
在这个过程中,我们会利用前面提到的认知地图和场景地图能力,对不同领域的信息进行结构化处理。在产品封装时,我们可以针对不同场景设置不同权重,这样,不同行业客户可以通过标准化接口快速接入,而不是每次重新开发一套系统。
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
热门跟贴