这项由南京理工大学、浙江大学和新加坡国立大学联合完成的研究于2026年7月发布,论文编号为arXiv:2607.07608,有兴趣深入了解的读者可以通过这个编号查询完整论文。
**机器人的"失忆症"**
假设你雇了一位新助手,让他帮你把厨房里的碗碟收拾好。他走到厨房,拿起一个碗,放进橱柜,然后……他转身看了一眼厨房,完全不记得自己刚才做了什么,也不知道还有多少件事没做完。于是他又随机拿起另一个物品,再放下,循环往复,效率极低,甚至会重复干同一件事。
这听起来像是一个可笑的极端情况,但实际上,这正是当今大多数机器人视觉-语言-动作模型(简称VLA模型)所面临的困境。这类模型是目前机器人技术中最先进的一类,它们能够同时理解图像、语言指令并输出动作。然而,它们中的大多数都有一个根本性的缺陷:每一次做决定,它们只看当前眼前的画面,完全不知道自己在这之前做过什么,也不了解整个任务进行到了哪个阶段。
研究人员把这个问题称为"时间短视偏差"。对于简单的单步任务,这个问题影响不大,就像只需要拿起一个杯子这样的动作。但当任务变得复杂、需要好几个步骤依次完成时,这个缺陷就会变得致命。机器人可能刚刚完成了第一步,却在第二步时完全忘记了第一步发生了什么,从而做出错误的判断。
正是为了解决这个问题,来自三所顶尖高校的研究团队提出了一个名为**LaMem-VLA**的新框架。这个名字里的"LaMem"代表"Latent Memory",也就是"潜在空间记忆",后面会详细解释这是什么意思。核心思路是给机器人装上一套真正有效的"双重记忆系统",让它不仅能看到眼前,还能记住过去,从而更好地规划未来。
一、现有方案为何行不通
在LaMem-VLA出现之前,研究人员已经意识到了这个问题,并尝试了多种方法来解决,但都存在各自的局限。
第一种思路是"扩大视野",也就是让机器人同时看更多的历史画面。比如把过去几秒内的多帧图像一起输入给模型,这样模型至少能看到最近发生了什么。这种方法直观好理解,就像你在看一段视频时回放几秒钟前的画面。然而问题在于,这种方式的计算量会随着历史帧数的增加而成倍增长,就像你要同时在脑子里处理越来越多的画面,很快就会撑不住。而且,能回看的历史帧数终归是有限的,一旦超出这个范围,更早发生的事情还是会被遗忘。
第二种思路是"建立外部记忆库",把历史信息存储在一个单独的数据库里,需要的时候再去查。这就好比一个厨师把菜谱写在一张纸条上,夹在围裙口袋里,需要时掏出来看一眼,然后继续做菜。这种方式在一定程度上有效,也有一些研究基于此取得了不错的成果,比如MemoryVLA模型就采用了类似的设计。
但这里有一个关键问题,研究团队发现了一个被以往工作忽视的深层缺陷:这个"外部记忆纸条"从来没有真正参与到厨师的思考过程中。厨师是在脑子里完成推理和决策的,而纸条只是在他做完决定之后、真正动手之前,才被拿出来看一眼,作为一种辅助参考。历史记忆和当前的思维推理过程是分离的,两者从未真正交融在一起。
用更技术性的语言来说,现有的方案把历史记忆存储在模型的"外部",在模型完成内部推理之后,才把记忆结果以"额外输入"的方式附加给决策头(action head),而不是让记忆真正融入模型的内部推理过程。这种结构性的分离,使得历史经验无法和当前的视觉感知、语言理解有机地结合在一起,从而形成更深层的理解。
研究团队由此提出了一个更根本的问题:历史经验能不能被表示成一种"原生于模型内部"的记忆形式,存储、检索和使用都在同一个连续空间里进行,也就是模型已经用来感知、推理和行动的那个空间?
二、双重记忆的哲学:短期与长期为何缺一不可
为了回答这个问题,研究团队首先思考了一个更基本的问题:对于机器人完成一项复杂任务来说,"记忆"到底应该记住什么?
以"把黑色碗拿起来放到植物盆上"这样一个任务为例。这个任务包含多个步骤,在执行过程中,机器人需要两种完全不同类型的历史信息。第一种是视觉层面的近期信息:碗现在在桌子的哪个位置?碗的状态有没有变化?它是否已经被移动过了?手臂的姿态在上一时刻是什么?这些信息来自当前这一轮任务的视觉画面,具有很强的空间性和即时性,类似于你在搬东西时用眼睛不断确认物体的位置。
第二种是语义层面的长程信息:整个任务完成了多少?下一步应该做什么?之前的动作序列是怎样的,有没有什么模式需要延续?这些信息更抽象,更宏观,不依赖于某一帧具体的画面,而是依赖于整个任务执行过程中积累的"进度感"和"语义理解"。
研究团队认为,这两种记忆在来源和功能上截然不同,但它们有一个关键的共同点:两者最终都应该被转换成同一种形式——模型内部空间里的"记忆令牌"(memory tokens),从而能被模型的推理过程直接消化和利用。这个洞察构成了LaMem-VLA整个设计的基石。
三、LaMem-VLA的四个核心组件:一个精密的记忆管家系统
整个LaMem-VLA可以用一个"档案室管理员"的比喻来理解。这位管理员负责整理、检索、压缩和使用历史档案,而机器人的大脑(也就是那个大型视觉语言模型)则负责真正的思考和决策。记忆系统和推理系统不再是分开的,而是协同工作、相互融合的。
**第一个组件是记忆馆长(Memory Curator)**,负责整理和存储历史经验。馆长把所有历史信息分成两个"档案柜"分开管理。第一个档案柜叫做"短期记忆库"(short-term memory vault),专门存储当前任务过程中的视觉信息。每隔一个时间步,馆长就会把当前的视觉图像经过一个压缩模块处理,生成一组精简的视觉令牌作为"档案内容"(value),同时计算这组令牌的平均值作为"档案标签"(key),用于之后快速检索。这两者合在一起构成一个记忆单元,被依次加入短期记忆库。
第二个档案柜叫做"长期记忆库"(long-term memory vault),专门存储行动历史信息。每个时间步,模型在处理完当前画面和指令之后,会生成一组"动作隐藏状态"(action hidden states),这是一种高度抽象的表示,捕捉了当前时刻的任务进度、行动意图和语义上下文。馆长直接把这些状态存入长期记忆库,随着任务推进而不断积累。
当记忆库中的条目数量超过上限(研究中设定为16个单元)时,馆长会启动一个压缩策略:找出时间上相邻的、最相似的两个记忆单元(通过计算它们标签之间的余弦相似度来判断),然后把这两个单元合并成一个,取它们的平均值。这就像当档案室快满了的时候,把两份内容高度相似的档案合并成一份,保留共同信息的同时腾出空间。
**第二个组件是记忆探寻者(Memory Seeker)**,负责根据当前情境检索相关的历史信息。探寻者不是随机翻档案,而是先弄清楚"现在我需要什么",然后有针对性地去找。具体来说,它会把当前的视觉令牌和指令令牌输入一个轻量级的"查询构建器",生成一组上下文感知的查询令牌,代表当前时刻的认知状态。然后,它把这些查询令牌的平均值作为全局检索向量,分别去短期记忆库和长期记忆库里进行匹配,找出最相关的若干条历史记忆(每个库各取前8个最相关的单元)。
这种设计的精妙之处在于,检索不是基于当前的原始图像或原始语言指令,而是基于模型处理过后的多模态认知表示。换句话说,不是直接拿着现在的照片去找相似的历史照片,而是拿着"我对现在这个场景的理解"去找"历史上哪些时刻和现在的理解最接近",这样能检索到更语义相关的历史经验。
**第三个组件是记忆压缩者(Memory Condenser)**,负责把检索到的大量历史证据压缩成紧凑的记忆令牌。经过探寻者检索得到的历史内容往往还是比较冗长的,而且不同条目之间可能存在重叠和冗余。如果直接把这些内容塞进模型的推理序列,会极大地增加计算负担,而且冗余信息反而会干扰推理。
压缩者的解决方案是引入一组可学习的"记忆槽"(memory slots):短期记忆槽有8个,长期记忆槽有4个。这些记忆槽就像可以改写的便利贴,压缩者把检索到的历史证据和当前的查询令牌一起输入一个轻量级的变换器模块,让这些便利贴"吸收"历史信息中最关键的部分,最终输出固定长度的短期记忆令牌和长期记忆令牌。
这个设计的核心价值在于"固定长度"——不管历史记忆库里有多少内容、检索出了多少条目,最终注入推理过程的记忆令牌数量始终是固定的(短期8个、长期4个),从而保证了计算成本不会随着任务变长而不断增加,就像无论厨房里有多少食材,最终端上桌的菜肴份数始终保持不变。
**第四个组件是记忆编织者(Memory Weaver)**,负责把压缩后的记忆令牌无缝地融入模型的推理序列。编织者把短期记忆令牌和长期记忆令牌分别加上两个可学习的"来源标记"(表明这是短期记忆还是长期记忆),然后把它们直接拼接在当前视觉令牌和指令令牌的前面,共同构成一个连续的输入序列,传入大型语言模型进行推理。
由于记忆令牌和当前信息处于同一个序列中,它们会通过自注意力机制相互交互,就像在同一个房间里的几个人可以互相交流,而不是把一个人隔在门外只通过纸条传话。模型在形成动作意图时,历史记忆、当前画面和语言指令共同参与了这个过程,三者真正融为一体。最终生成的"动作令牌"已经是被历史记忆充分浸润和塑造的,然后这些动作令牌会被传给一个基于扩散模型的动作生成器,产生具体的七自由度控制指令。
四、实验场景与测试结果:数字背后的意义
研究团队在两个不同的模拟环境中对LaMem-VLA进行了全面测试,用的都是机器人学领域常用的标准基准平台。
第一个测试平台叫做**SimplerEnv-Bridge**,它的特点是用真实世界采集的数据来训练模型,但在仿真器中进行评估,专门测试模型的"真实到仿真"泛化能力。测试任务包括把勺子放到毛巾上、把胡萝卜放到盘子上、堆叠积木、把茄子放进篮子,共四项任务,每项任务测试24次,最终统计平均成功率。
LaMem-VLA在这四个任务上的成绩分别是83.3%、75.0%、41.7%和95.8%,平均成功率为73.9%。作为对比,研究使用的基础模型CogACT(一个性能已经相当不错的VLA模型)的平均成功率只有57.3%,也就是说LaMem-VLA提升了整整16.6个百分点。另一个知名模型π0的成绩是69.2%,LaMem-VLA超过了它4.7个百分点。在和带有记忆机制的对比方法MemoryVLA的比较中,LaMem-VLA以73.9%对71.9%的成绩胜出。
第二个测试平台叫做**LIBERO**,这个基准更复杂,包含五个测试套件:空间感知任务(Spatial)、物体操作任务(Object)、目标完成任务(Goal)、长程推理任务Long-10(10个任务)和Long-90(90个任务),使用Franka机械臂进行测试。LIBERO是目前机器人操作领域最有挑战性的综合测试之一,特别是Long-90套件,包含了大量需要多步骤推理和历史感知的任务。
LaMem-VLA在五个套件上的成绩分别为空间98.8%、物体99.0%、目标97.2%、Long-10的95.8%、Long-90的97.0%,五项综合平均成功率达到97.6%。相比基础模型CogACT的93.2%,提升了4.4个百分点。相比MemoryVLA的96.5%,提升了1.1个百分点。在长程任务上,LaMem-VLA在Long-10上超过MemoryVLA 2.4个百分点,在Long-90上超过1.4个百分点,而长程任务恰恰是最能体现记忆机制价值的场景。
这些数字背后的含义是:在一项需要机器人连续完成多个子任务的长程操作中,具有双重记忆的LaMem-VLA明显比那些只能依赖当前画面或者只有外部记忆的模型更加稳健,更少在中途迷失方向。
五、拆解实验:每个设计选择究竟贡献了多少
研究团队还做了一系列精心设计的消融实验,也就是"拆零件"测试——每次拿掉一个组件,看看成绩会下降多少,从而验证每个设计选择的必要性。
**关于双重记忆的贡献**,研究分别测试了四种情况:同时使用短期和长期记忆的完整模型、只有长期记忆而没有短期记忆的版本、只有短期记忆而没有长期记忆的版本,以及完全没有任何记忆的版本。结果表明,在SimplerEnv上,完整版本的73.9%成绩在拿掉短期记忆后降至65.6%,拿掉长期记忆后降至64.6%,两者都拿掉后降至与基础模型相同的57.3%。这清楚地说明了两种记忆各有不可替代的作用:短期记忆保留了视觉层面的即时信息,长期记忆提供了任务进度的语义连贯性,两者缺一不可,并且是互补关系而不是重叠关系。
**关于记忆注入方式的贡献**,研究比较了三种方案:完全没有记忆的基础模型、把记忆作为外部条件传给动作头(即传统的"政策侧记忆"方式)、把原始检索内容直接插入推理序列(不经过压缩)、以及LaMem-VLA的完整方案(压缩后的记忆令牌融入推理序列)。结果在SimplerEnv上分别为57.3%、71.9%、69.8%和73.9%。有趣的是,把原始检索内容直接塞入推理序列的效果(69.8%)反而比把记忆作为外部条件(71.9%)还要差一些,这说明不经过压缩的冗余历史信息会干扰推理,反而有害。而经过压缩的LaMem-VLA则超过了所有对比方案,说明"融入推理序列"和"先压缩再融入"这两个设计选择都不可缺少。
**关于检索数量K的影响**,研究测试了每个记忆库检索2、4、8、12个单元时的成绩。结果显示,从2增加到8时性能持续上升(SimplerEnv从66.7%到73.9%),但从8增加到12时性能略有下降(到71.8%)。这个"倒U型"关系说明检索太少会导致历史证据不充分,而检索太多则会给压缩者带来过重负担,引入太多与当前无关的历史噪音,导致压缩质量下降。
**关于记忆令牌数量的影响**,研究测试了短期记忆令牌数量(Ls)从2到32的变化,以及在固定Ls=8的前提下长期记忆令牌数量(Ll)从1到16的变化。总体规律是更多的记忆令牌能保留更多历史细节,但超过一定数量后提升趋于饱和,同时会增加计算成本。综合性能和效率,研究最终选择了Ls=8、Ll=4的配置作为默认值,在两个基准上均达到了最优性能。
六、局限性与未来展望
研究团队在论文中坦诚地指出了当前版本的主要局限:所有实验都在仿真环境中进行,尚未在真实的物理机器人上验证。仿真环境虽然可以精确控制变量、大规模测试,但真实世界中的噪音、光照变化、物体形变等因素远比仿真复杂。研究团队表示正在将LaMem-VLA迁移到真实机器人平台,相关结果将在后续版本中发布。
此外,当前LaMem-VLA只使用单个第三人称视角的RGB摄像头,而一些竞品模型使用了额外的本体感知(关节角度等)和腕部摄像头输入。即便在这种输入条件更受限的情况下,LaMem-VLA依然超过了那些使用更多输入的模型,这一点格外值得关注。
说到底,LaMem-VLA解决的不是一个小问题。VLA模型的"失忆症"是整个机器人领域迈向真正实用化的核心障碍之一,因为现实世界里几乎所有有价值的任务都需要多个步骤依次完成,而不是孤立的单次动作。这项研究给出的答案不是"让机器人看更多历史画面",也不是"给它加一个外挂记忆数据库",而是提出了一种让记忆真正"入驻"模型思考过程内部的方式。短期的视觉记忆和长期的语义记忆各司其职,又相互配合,共同帮助机器人在每一个决策时刻都保持对任务全貌的清醒认识。
这对普通人意味着什么?家用服务机器人、工厂流水线机器人、手术辅助机器人——任何需要机器人完成多步骤任务的场景,都可能从这类技术中受益。机器人不再会因为"忘了上一步做了什么"而重复工作或犯低级错误。当然,从实验室到家庭和工厂还有很长的路要走,真实世界的验证是下一个关键挑战。对于想深入研究这项技术的读者,可以通过arXiv:2607.07608查阅完整论文。
Q&A
Q1:LaMem-VLA的短期记忆和长期记忆分别存什么内容,有什么区别?
A:短期记忆库存储的是当前任务过程中的视觉信息,比如物体在画面中的位置和状态变化,用压缩后的视觉令牌表示,以键值对的形式存储,方便快速检索。长期记忆库存储的是模型每个时间步生成的"动作隐藏状态",这是一种更抽象的表示,反映的是任务进度、行动意图和语义连贯性。两者的本质区别在于:短期记忆偏视觉、偏即时,长期记忆偏语义、偏全局,两者互补,共同支撑机器人的历史感知能力。
Q2:LaMem-VLA和MemoryVLA有什么根本区别?
A:MemoryVLA把历史记忆存储在外部记忆库中,检索后作为额外输入传给动作决策模块,记忆和推理过程是分开的,记忆只在推理结束后才被附加进来。LaMem-VLA则把压缩后的记忆令牌直接拼接进模型的推理输入序列,让记忆和当前的视觉信息、语言指令在同一个推理过程中通过自注意力机制相互交互。这意味着历史记忆真正参与了模型的内部思考,而不是"事后附加"的参考材料,因此能更自然地影响动作生成。
Q3:LaMem-VLA目前有没有在真实机器人上测试过?
A:目前LaMem-VLA的所有实验结果都来自仿真环境,分别是SimplerEnv-Bridge和LIBERO两个模拟平台。研究团队在论文中明确指出这是当前版本的主要局限,并表示正在将该框架迁移到真实物理机器人平台进行测试,实验结果将在后续版本的论文中公布。
热门跟贴