在过去数年里,大语言模型(LLM)能力的跃升在很大程度上被归因于规模法则(Scaling Laws)——即参数量、训练数据规模以及计算预算的协同扩张。然而,随着模型推理上下文的不断拓展、长程复杂任务的持续涌现,以及智能体(Agent)范式的深入演化,一个同样基础却长期被分散讨论的架构维度正逐渐走向前台:记忆(Memory)。
传统的语言模型中,记忆往往以一种隐式、瞬态的方式存在于前向计算流之中——最典型的便是 Transformer 的自注意力机制及其生成的 Key-Value(KV)缓存。这种机制虽具备灵活的基于内容寻址能力,但其二次方计算开销与线性增长的显存占用,使其在面对超长上下文与多轮持续交互时面临严峻的资源瓶颈。
为应对这一挑战,学术界与工业界近年来涌现出大量探索:从以 Mamba、RWKV-7、Gated DeltaNet 为代表的高效循环与状态空间模型,到以 Titans、TTT(Test-Time Training)为代表的测试期动态参数更新,再到 Engram 等基于可扩展哈希查找的显式存储模块,以及 MoE 架构中的条件参数激活。然而,这些研究大多分散在高效序列建模、长上下文推理、测试期自适应及外部存储等不同细分领域,缺乏统一的形式化框架与概念对照。
近期,来自清华大学、新加坡国立大学与博世人工智能研究院的研究团队撰写了综述论文《Memory for Large Language Models》,首次从模型底层架构与计算机制的视角,对大语言模型中的记忆系统进行了系统性的梳理与解构,提出了涵盖表示形式、更新动力学和持久性三个正交维度的分类体系,并深入剖析了混合记忆架构的设计权衡、系统级效率优化及多维度评测范式。
论文链接:https://arxiv.org/pdf/2607.25380
记忆范式的演进:从隐式计算副产物到第一架构公民
在大模型发展的早期阶段,记忆并未被视作一个独立的架构组件,而是紧密依附于前向计算图的瞬态副产物。在标准 Transformer 架构中,历史上下文信息被即时编码为注意力状态,并在当前推理步骤结束后随之释放或阶段性丢弃。
随着任务复杂度的提升,记忆的形态正发生根本性转向:
- 从紧耦合到结构解耦:记忆不再完全受限于固定的激活张量,而是以独立的可寻址槽位、参数化子空间或外部知识库形式存在。
- 从静态参数到在线可塑性:模型的知识更新不再局限于离线预训练阶段,测试期梯度写入、门控状态转移与多时间尺度更新赋予了模型在推理期的动态可塑性。
- 从瞬态留存到跨周期持久化:长程压缩状态与持久化存储模块使模型能够在更长序列乃至跨交互周期中持续保留关键信息。
这一范式转变促使研究团队重新审视“模型记忆”的本质,并建立能够统摄不同技术路线的系统性认知框架。
图1|大语言模型记忆机制的演进。记忆逐渐从依附于前向计算的隐式状态,发展为具备独立表示、更新与持久化能力的架构维度。
统一分类体系:三维正交视角
针对文献中对“记忆”一词指代模糊、抽象层次不一的问题,该综述明确将讨论范围限定在模型级(Model-level)记忆机制——即在模型架构或其推理动力学内部实例化的记忆,排除了依赖外部编排流程或提示工程的纯智能体级系统。在此基础上,综述提出了由三个正交轴构成的三维分类框架。
图2|综述框架与分类体系。三个主轴分别刻画记忆如何表示、何时及如何更新,以及能够维持多长时间的有效影响。
1.表示形式(Representation):隐式记忆 vs. 显式记忆
该维度界定了记忆在模型内部的物理存在形态与访问接口:
- 隐式记忆(Implicit Memory):信息作为前向计算的中间副产物存储,与模型的计算图深度绑定,不具备独立的读写或寻址接口。例如 RNN / SSM 的隐藏状态、Transformer 的 KV 缓存等。
- 显式记忆(Explicit Memory):信息存储于具有明确访问语义的独立组件中,支持独立的寻址、检索与更新操作。显式记忆既可以是非参数化的表格或键值库(如 Engram、kNN-LM),也可以是专门设计了读写策略的参数化模块(如 Titans、LM2)。
2.更新动力学(Update Dynamics):离线更新 vs. 在线更新
该维度界定记忆被修改的时间节点与触发机制:
- 离线记忆(Offline Memory):仅在离线训练阶段通过反向传播或静态构建进行优化,推理期间保持固定(如预训练权重、标准 MoE 路由参数)。
- 在线记忆(Online Memory):在推理期支持动态内容更新,更新频率可细化为逐 Token、逐块或按需触发。
为了更深入地刻画在线机制的微观行为,综述进一步提炼出五种细粒度更新规则(Fine-Grained Update Rules):
- 优化驱动写入(Optimization-based writing):在推理期通过最小化显式辅助目标函数更新快速权重(如 TTT-E2E、Titans)。
- 状态转移更新(State-transition updates):基于显式递推方程、Delta 规则或滤波算法更新循环隐状态(如 Mamba、Gated DeltaNet-2、Kalman Linear Attention)。
- 信号门控写入/路由(Signal-gated writing or routing):利用预测误差、惊讶度(Surprise)或不确定性指标动态触发显式写入或昂贵计算分支(如 AMOR、HAM)。
- 准入、淘汰与合并(Admission, eviction, and consolidation):对缓存或存储条目进行筛选、替换与周期性压缩(如 StreamingLLM、RATTENTION)。
- 目标诱导/结构更新(Objective-induced or structural updates):通过辅助训练目标或结构替换塑造记忆表征分布(如 Next-Latent Prediction)。
3.持久性(Persistence):短期记忆 vs. 长期记忆
该维度关注存储信息对模型后续计算产生有效影响的时间跨度:
- 短期记忆(Short-Term Memory):以细粒度、低压缩率保存局部信息,通常局限于固定上下文窗口或单次推理会话内(如注意力 KV 缓存)。
- 长期记忆(Long-Term Memory):依托高度压缩的动力学状态(如循环状态空间)或独立物理存储(如参数化持久槽位),跨越超长序列甚至多会话维持对计算的有效影响。
表1|代表性工作的分类汇总。表格按照各模型的主要记忆机制,归纳其更新动力学、持久性与核心范式;部分方法同时具有多个维度的混合属性。
隐式记忆:基于计算动力学的上下文建模
隐式记忆是现代深度序列模型的基础。它不依赖外部存储接口,而是利用前向计算过程本身实现历史信息的汇聚与传递。
1.注意力作为内容寻址瞬态工作记忆
自注意力机制可被数学化地解释为一种连续可微的内容寻址工作记忆(Content-Addressable Memory,CAM)。然而,完全注意力机制受限于二次方复杂度与 KV 显存开销。近期研究通过 Multi-head Latent Attention(MLA)对键值联合压缩,或通过 StreamingLLM 的“注意力汇(Attention Sinks)”机制维持滑动窗口下的生成稳定性。HyperMLP 等新工作则进一步将注意力重构为输入条件化的序列混合算子,展现了隐式记忆访问几何的多样性。
2.稀疏、选择性与结构化访问控制
为突破上下文容量瓶颈,研究团队在注意力中引入了准入与稀疏路由机制:
- 静态与内容路由稀疏:从早期固定模式的 Sparse Transformer、Longformer,发展为 MoBA(块级内容路由)与 Native Sparse Attention(NSA,层级化硬件对齐稀疏)。
- 选择性准入与局部-全局解耦:Selective Attention 通过数据驱动门控动态放大显著信息;RATTENTION 则系统证明了仅需极少量的全局锚点 Token 即可有效稳定超长序列推理。
3.循环序列记忆:状态压缩与精准编辑
不同于注意力的全历史保留,循环序列模型将历史压缩为固定或对数增长维度的隐藏状态:
- 线性注意力与 SSM:Mamba 系列引入选择性状态空间与对偶表征(SSD),Mamba-3 进一步拓展至复数域与多输入多输出(MIMO)系统。
- Delta 规则与状态精准编辑:为缓解循环状态的有损压缩与干扰,Gated Delta Networks、RWKV-7、Kimi Linear(KDA)及 Gated DeltaNet-2 引入了通道级门控衰减与解耦擦写机制,使循环状态具备了类似于矩阵联想记忆的定向修改能力。
- 统计滤波与分层容量:Kalman Linear Attention 与 Gated KalmaNet 将贝叶斯滤波与岭回归引入状态估计;Log-Linear Attention 则通过树状分层状态实现了随序列长度对数增长的非均匀分辨率存储。
图3|隐式记忆机制。注意力保留细粒度 KV 状态,稀疏与选择机制控制访问范围,循环序列记忆则通过 RNN、线性注意力或 SSM 状态压缩历史。
显式记忆:解耦寻址与自适应存储
尽管隐式记忆计算效率高,但其容量受限于隐状态维度,且难以脱离前向图实现持久化与受控修改。显式记忆通过解耦存储基质与瞬态计算,为大模型提供了更为开阔的扩展空间。
1.参数化外部记忆模块
借鉴经典快速权重(Fast Weights)与神经图灵机(DNC)思想,前沿模型开始将专门的参数子空间作为在线记忆载体:
- 测试期动态优化:Titans 设计了由“惊讶度”梯度驱动的专用长期记忆模块;TTT-E2E 将测试期自适应融入端到端架构;In-Place TTT 则直接复用标准 MLP 内部投影矩阵作为快速权重。
- 专用隐式槽位:MEMORYLLM 与 LM2 在 Transformer 层间引入专用的可自更新潜在记忆槽(Memory Slots),实现了无需全模型微调的知识吸纳。
2.查找式与检索导向记忆
该路线旨在为模型提供直接可寻址的离散或密集存储表:
- 外部数据存储增强:kNN-LM 通过离线构建上下文-目标词数据存储库提升罕见知识预测。
- 模型内置可扩展哈希存储:Engram 提出了基于哈希寻址的条件记忆机制,将存储稀疏性与计算稀疏性解耦,使参数容量能够以极低算力开销实现独立扩展。
- 可编辑与解耦记忆库:PlugLM 与 ExplicitLM 分别探索了可插拔键值层与可读文本条目记忆库,显著提升了模型参数知识的局部可编辑性与可解释性。
3.条件参数记忆:MoE 的记忆学诠释
Mixture-of-Experts(MoE)架构通常被视作稀疏计算技术,但从记忆视角审视,每一个 Expert 实质上是参数空间中的一个模块化知识块。路由器(Router)根据输入语义执行上下文寻址。DeepSeek-MoE 与 Mixtral 的细粒度专业化分工,展现了条件参数作为结构化离线记忆的有效性。
4.多时间尺度与嵌套更新
记忆的生命周期不应是非黑即白的。Nested Learning 与 Slow-Fast 参数分解机制表明,在大模型内部构建多更新频率的层级结构(从逐 Token 演化的瞬态状态,到按批次/会话更新的快速权重,再到冻结的骨干网络),是化解持续学习中“稳定性-可塑性困境(Stability-Plasticity Dilemma)”的重要途径。
图4|显式记忆机制。参数化模块、可寻址存储、条件参数路由与多时间尺度更新,分别提供了不同程度的存储独立性与更新控制能力。
混合记忆架构与系统级考量
单一记忆范式难以兼顾高保真召回、无限长外推、低计算延迟与跨会话持久性。因此,混合记忆架构(Hybrid Memory Architectures)正成为当前模型设计的核心演进方向。
1.混合范式的典型模式
- 固定比例与分层交织:较为熟知的 Kimi Linear 以约 3:1 的比例交错使用 Kimi Delta Attention(KDA)与 Multi-head Latent Attention(MLA),Qwen3-Next 也以类似比例混合 Gated DeltaNet 与全注意力层。Samba 则代表 Mamba 与滑动窗口注意力的逐层交替;LightTransfer 与 Priming 进一步探索了预训练 Transformer 层的轻量化替换与知识迁移。
- 自适应动态路由混合:AMOR 利用归一化输出熵动态门控注意力细化模块;HAM(Hybrid Associative Memory)则由循环状态处理常规 Token,仅将“预测意外”的困难 Token 准入稀疏 KV 缓存,实现了计算资源与存储精度的自适应按需分配。
- 隐式与显式协同:Titans 与 Hydra 分别展示了在紧凑注意力/SSM 骨干之上,叠加显式可写模块或检索增强分支的系统级组合方案。
2.系统效率与评测体系
在落地部署层面,PagedAttention(内存虚拟化)、CommVQ(KV 缓存矢量量化)以及 Memory Caching(循环状态快照缓存)等技术重塑了显存带宽与吞吐的物理边界。
在评测层面,传统的困惑度(Perplexity)已无法完整反映记忆品质。综述指出,必须建立涵盖检索保真度(如 Needle-in-a-Haystack、RULER)、长程结构推理(如 SCROLLS)、干扰抗性与遗忘速度、以及显存-吞吐效率曲线的多维评测矩阵,才能精确解构模型真实具备的记忆能力。
开放挑战与未来方向
针对大语言模型记忆机制的研究仍处于快速演变期,综述指出了六个亟待突破的前沿方向:
- 大模型记忆的统一理论抽象:从状态转移与信息论视角建立形式化数学框架,科学量化容量界限与压缩保真度。
- 终身参数化记忆与持续学习:探索流形约束(如正交低秩更新)与结构化隔离机制,防止测试期参数更新引发灾难性遗忘与表示漂移。
- 稳健且可逆的更新控制律:提高信号门控准入机制对长程时序依赖的先见性,探索可诊断、可逆向回滚的动态记忆管理。
- 自适应动态资源调度:从人工设定的静态层混合,走向由数据复杂度驱动的动态记忆路径自适应分配。
- 软硬件协同设计(Hardware-Algorithm Co-Design):针对 GPU/加速器层次化存储(SRAM、HBM、DRAM)定制层级化记忆算法,突破内存墙约束。
- 解耦化的基准测试与诊断:构建能够剥离模型基础推理能力与先验偏置、纯粹评估记忆生命周期各环节的标准化基准。
总结
从依赖前向计算的隐式、瞬态状态,走向具备自主寻址与受控更新能力的显式、持久记忆系统,大语言模型正在经历深刻的底层架构重塑。本综述提出的机制中心型分类体系与权衡分析,不仅厘清了当前碎片化的研究脉络,也为构建下一代高扩展、高可塑与自主进化的大模型记忆架构提供了系统性的方法论参考。
热门跟贴