Spatial-TTT 给 2B 模型装上“流式空间记忆” ,在空间基准上超越 GPT-5。
作者丨张 璐
编辑丨幸丽娟
单纯拉长上下文,可以解决“能塞进多少信息”的问题。但面对状态变化、时序关联这类长程任务时,注意力还是容易被稀释,关键证据也容易找不回来。
当场景扩展到具身机器人、自动驾驶和智能硬件这些需要与三维物理世界实时交互的领域时,这一矛盾被进一步放大。
与纯文本或静态图文不同,真实物理世界的输入天然是持续涌入、没有明确边界的视频流。智能体在空间中移动时,视角不断切换、物体频繁被遮挡,这些都要求系统必须具备流式空间智能——一边接收视频流,一边实时构建并更新环境的三维空间记忆。
主流方案在处理这种连续视频流时,普遍在工程与架构上面临两重限制:
算力与显存边界的硬性制约:基于标准 Transformer 自注意力机制的计算与 KV Cache 显存开销随序列长度呈二次方级攀升。在长达数十分钟甚至数小时的连续视频输入下,即便采用先进的长序列优化策略,端侧受限硬件也很容易因为显存急剧膨胀而无法继续运行。
时序下采样对几何连续性的破坏:工程中常用的均匀抽帧或关键帧截取方案,本质上是以牺牲细粒度时序信号为代价来换取计算效率。但 3D 空间关系高度依赖连续的视差与几何线索,大幅跳帧会让模型直接漏掉关键的空间信息,而且事后很难补回来。
产生这些现象的根本原因,是“推理时参数完全固定”和“物理世界持续动态变化”之间的不匹配。传统多模态模型在推理阶段所有权重都冻住了,面对源源不断涌入的视频流,只能把每一帧当成离散 Token 被动堆进上下文,缺少一套能在推理过程中实时整合、更新三维几何信息的内部记忆机制。
为了解决这个问题,清华、腾讯混元、南洋理工的研究团队在最新论文《Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training》中,把重心从“继续拉长注意力窗口”转向了“在推理过程中让参数在线自适应更新”。
论文链接:https://arxiv.org/pdf/2603.12255
他们基于测试时训练范式,把模型的一部分参数变成可以在推理过程中动态更新的“快权重”,用它充当紧凑的非线性空间记忆。这样既能保持线性计算开销,又能让模型在源源不断的长视频中持续记住空间细节,并理解前后帧之间的位置关系。
核心就是打破参数固定的限制,让模型随着视频输入实时更新自己的空间记忆(见下图1)。
图1 Spatial-TTT 整体流程示意
01
为什么不能全用 TTT?
3:1 混合架构的取舍
面对流式长视频,想把计算开销从二次方压到线性,测试时训练(TTT)提供了一种新的架构思路:打破“推理阶段参数必须完全固定”这个前提。
处理连续视频时,模型会维护一组叫“快权重”的小型可更新参数ₜ。每来一批视觉 Token,它就用自监督损失算梯度,通过在线梯度下降把当前信息写进快权重;之后需要用到历史上下文时,直接用更新后的权重做前向计算就行。快权重就成了能在线更新、压缩历史信息的动态记忆。
然而,如果把多模态大模型里所有自注意力层都换成纯 TTT,性能会立刻大幅下滑。
▎纯 TTT 会伤语义对齐,所以保留 25% 全注意力层
预训练大模型最重要的能力之一,是已经学好的多模态图文对齐和通用逻辑推理。自注意力虽然算力贵,但能让全局特征充分交互,保证语义不丢失。
实验表明,如果在长序列里完全去掉自注意力、全部换成纯 TTT,模型在长程推理(尤其是多跳选择题和复杂逻辑判断)上的表现会明显下滑。
在 VSI-Bench 消融实验中,纯 TTT 架构的综合分数从 64.4% 降到 53.9%,多选题准确率更是掉了超过 12 个百分点。
为了在“长程时序压缩”与“全局语义推理”之间寻找平衡,Spatial-TTT 采取了一种混合架构:
3:1 的层级交织:在 Decoder 里,每 4 层注意力中有 3 层改成 TTT 层,专门负责长视频里空间时序信息的动态压缩和增量更新;
保留 25% 的全注意力锚点层:这些层继续做全局注意力,参数不更新,主要负责跨模态特征的全局对齐和逻辑推理,用很低的计算代价保住预训练模型原有的推理能力。
▎大块更新提升效率,滑动窗口补回局部连续性
在工程落地时,TTT 层还有第二个矛盾:硬件并行效率和局部因果连续性很难同时兼顾。
在纯文本 TTT 方案中,为了追求实时性,通常采用极小的 Chunk(如 16 或 64 个 Token)进行高频快权重更新。
但这种模式直接搬到流式视频场景下却行不通:一方面,分块太小会导致 GPU 无法充分并行,吞吐效率极低;另一方面,单帧画面或连续动作包含数千个视觉 Token,频繁切分会直接破坏画面的时空连续性。
为了让 TTT 能高效处理视频,Spatial-TTT 采用了覆盖多帧的大块更新策略(Chunk Size 设为 2648 个 Token),显著提升了并行效率和帧级空间聚合能力。
但这带来了新的问题:为了防止信息向前泄漏,大块更新时,当前 Chunk 内部的 Token 不能互相看到、也不能做自注意力。如果不管这个隔离,同一块里的视频帧之间就会丢掉局部时空连续性。
为了弥补大块更新带来的时空割裂,Spatial-TTT 在每个 TTT 层里用了双路并行结构:
主干路(TTT 分支):负责跨 Chunk 的长程记忆,通过持续更新快权重来保存长期的空间环境信息;
旁路(滑动窗口注意力 SWA):和 TTT 分支共享、、投影,窗口大小 不小于 Chunk 大小。SWA 负责覆盖 Chunk 内部的因果注意力,把单帧内部以及相邻帧之间的细粒度时空关系补回来。
通过“3:1 混合”和“大块更新 + 滑动窗口”的组合,系统既避免了纯 TTT 带来的语义退化,又避开了全注意力的显存瓶颈,同时兼顾了长视频处理的效率和空间推理能力。
这套设计最终被整合成一套完整的解码流程(如图2)。
图2 Spatial-TTT 混合架构与 TTT 层内部结构。左侧为整体解码器结构,右侧展示单个 TTT 层的双路并行设计。
从右侧的细节中可以清晰看到,数据在流经快权重之前,经历了一个关键的“3D Spatiotemporal Conv”模块。这个看似轻量的卷积改动,恰恰是击穿传统离散 Token 局限、为快权重注入三维连续几何偏置的核心命门。
02
让快权重真正“看懂”三维空间:
3D 卷积与稳定更新
解决了底层架构和吞吐问题后,下一个关键是:如何让输入的视觉特征真正具备三维物理上的连续性。
在标准大语言模型或传统视觉 Transformer 里,、、 通常靠逐点线性投影生成。这种做法默认每个 Token 是相互独立的离散点,只能靠后面深层的自注意力去建立关联。
但对连续的 3D 空间视频流来说,这种纯逐点投影会带来明显问题:
空间结构被打碎:视频被切块、展平成一维序列后,逐点投影把原本相邻的像素和体素拆成了互不相干的点。局部视差、边缘连续性、深度梯度这些天然存在的空间关系,在进入快权重更新之前就已经丢失了。
缺少空间先验,只能硬猜:快权重本质上是靠拟合当前块的 和来记东西。如果 和本身没有局部空间信息,它就只能从一堆孤立的点里硬推 3D 结构,既容易造成梯度震荡,学到的空间表示也不稳定。
为了让快权重真正理解物理世界的三维连续变化,Spatial-TTT 引入了空间预测机制,从特征生成和在线更新方式两个层面改造了 TTT 分支。
▎用 3D 卷积给视觉特征加入局部几何信息
空间预测机制的核心,是在 TTT 分支生成、、 之后,先把它们重新整理成时空体素网格,再挂上一个轻量的 3D 深度可分离卷积。
用 3×3×3 这样的局部三维邻域做特征聚合,就能给每个视觉 Token 明确注入周围像素的空间关系和前后帧的时序动态。经过 3D 卷积后的K̃ 与 Ṽ已经融合了局部时空信息。快权重更新时,学的不再是单个 Token,而是连续画面里的几何变化和空间结构。
为了不破坏预训练模型已有的视觉能力,卷积核用了狄拉克初始化。训练刚开始时,这个卷积在数学上等价于恒等映射,模型可以先平滑继承基座能力,再慢慢学局部几何偏置。
消融实验也证明了这一点:在 VSI-Bench 上,去掉空间预测机制、退回传统逐点投影后,数值空间推理(绝对距离、房间尺寸等)准确率从 64.0% 降到 60.7%。说明局部空间和时序信息对提升度量精度很关键。
▎用 Muon 优化器让在线更新更稳定
特征处理解决后,另一个关键问题是在线参数更新稳不稳。
传统 TTT 多用简单的随机梯度下降更新快权重。但面对高维、噪声大的多模态空间特征时,普通 SGD 很容易被噪声带偏,导致权重矩阵分布失衡,出现特征漂移甚至数值溢出。
所以 Spatial-TTT 换用了带动量和正交约束的Muon 优化器。每一步大块更新时,先累积动量,再用 Newton-Schulz 迭代把更新方向正交化;参数更新完后,对快权重做模长归一化,既保留原来的尺度,又防止在无限长视频流里连续更新导致权重爆炸。
03
训练数据怎么选?
从稀疏问答到密集场景描述
架构搭好之后,核心问题变成了训练:如何引导快权重真正记住三维空间的全局信息。
测试时训练是否有效,关键取决于模型在离线阶段有没有学会“怎么更新快权重”。也就是要识别哪些视觉特征对未来有用,并在每一步在线更新时,主动把这些特征写进长期记忆。
但现有的空间智能数据集,在监督信号上存在严重的“先天缺陷”。
▎传统空间问答数据的问题:监督信号太弱
目前主流的空间问答数据,大多是单选题或极短的数值填空,比如“红色椅子在桌子哪一边”或“房间里有几个杯子”。
这种形式训练普通多模态模型还可以,但用来训练 TTT 的快权重更新,就暴露出明显的问题。
首先就是信号太弱。一个选项或一个数字携带的信息量太少,不足以推动快权重去记住完整的 3D 场景。模型很容易只学会针对具体短问题的应付策略,换个问法就失效。
其次,单个字母或整数提供的监督非常有限,很难激励快权重建立起持久、结构化的全局三维表示。学到的更新方式往往很脆弱,一旦离开具体问题,之前记住的特征就容易丢掉。
▎用密集场景描述提供更强的训练信号
为了打破弱监督瓶颈,团队基于 3D 场景图构建了一套密集场景描述数据集(覆盖 ScanNet 和 ARKitScenes,约 1.6 万个室内漫游样本)。
训练时,模型看连续的室内漫游视频,目标不再是短问答,而是生成一段包含全局信息的连贯场景描述。这段描述需要覆盖三个维度:
全局场景环境:说明房间类型和整体布局,先让快权重建立起宏观空间框架;
实体清单与精准计数:详细列出视野中出现过的所有物体类别和数量,促使快权重在长时序中持续追踪每个实例,避免物体移出视野后就被忘掉;
物体空间关系:描述物体之间的相对方位和距离,引导快权重记录它们的空间布局关系。
这种密集的全局场景描述,为快权重提供了高覆盖率、高密度的反向传播梯度,教导模型在处理视频流的每一个 Chunk 时,都能主动将具有长久价值的三维几何与拓扑信息编码进快权重中。
▎两阶段训练:先打基础,再做任务精炼
在拥有了强监督数据后,如何让预训练模型平滑过渡到流式 TTT 模式,同样需要精密的训练调度。团队设计了一套两阶段渐进式训练方案:
第一阶段:用密集描述打基础,同时做滑动窗口退火
如果一开始就把滑动窗口设得很小,强行让还没训练好的 TTT 去扛长程信息,训练初期梯度很容易剧烈震荡。所以团队用了滑动窗口退火:一开始把窗口设得足够大(比如 5600 tokens),能覆盖整个输入序列,让自注意力先兜底;随着训练推进,窗口线性缩小,直到和 Chunk 大小 (2648 tokens)对齐。
这个过程中,注意力的有效范围逐渐变小,倒逼 TTT 层的快权重慢慢承担起跨 Chunk 的长程信息传递和记忆职责。
第二阶段:用大规模空间问答做精炼
等快权重已经能捕捉全局 3D 结构后,第二阶段接入约 300 万条空间问答数据(涵盖绝对距离、相对朝向、路径规划、房间尺寸等任务)。
这时窗口和 Chunk 大小固定对齐,TTT 分支全面负责跨块空间信息的检索和利用,让模型进一步提升空间推理和指令遵循能力。
消融实验也印证了这一点:在 VSI-Bench 上,如果去掉密集场景描述的预训练阶段,模型平均分从 64.4% 降至 61.3%,在房间尺寸、相对朝向等强依赖长程记忆的任务上退化尤为明显。这表明,高密度的场景监督是模型建立长期空间记忆的前提。
04
实验结果:2B 模型在空间基准
和长视频上的表现
结合混合架构、3D 卷积和密集场景监督后,Spatial-TTT-2B 在多个空间基准上取得了明显优势。
下面分三个方面来看具体的表现。
▎VSI-Bench 与 MindCube 上的表现
在 VSI-Bench 上,Spatial-TTT-2B 取得 64.4 的综合平均分,超过 GPT-5(55.0)和 Gemini-3-pro(56.0)。其中在相对朝向任务上达到 73.0%,显著高于 GPT-5 的 48.6%
在数值问答任务中,模型在物体计数上达到 70.8%,绝对距离估计达到 47.8%,房间尺寸估计达到 65.9%,多项指标领先同量级及部分大参数模型。
在专门测试跨视角一致性与遮挡推理的MindCube-Tiny上,优势更明显:Spatial-TTT-2B 达到76.2%综合准确率,比 Gemini-3-pro(63.9%)高 12.3 个百分点,比开源空间模型 MindCube-3B(51.7%)高 24.5 个百分点。在环绕(AROUND, 89.8%)和穿透(AMONG, 74.0%)子集上的表现尤为突出。
这种在细粒度空间几何任务上的越级反杀,直观地体现在了与各大主流模型的全维度横向对比之中。
先看通用空间理解能力:(见表 1)
表1 VSI-Bench 各模型详细得分对比。
如表 1 所示,面对参数量大数十倍的闭源旗舰,2B 的流式架构在通用空间基准上依然具备明显优势。而在专门诊断视角旋转与物体遮挡的 MindCube-Tiny 基准中,这种跨视角空间推理的代差更为突出。
再看跨视角和遮挡场景下的表现(见表 2):
表2 MindCube-Tiny 跨视角空间推理结果,包含旋转、穿透、环绕三个子集。
表 1 与表 2 充分验证了模型在静态与多视角离散任务中的空间推理能力;然而,在实际具身场景中,真正的终极考验在于将时序无限拉长。面对连续数十分钟乃至数小时的连续视频流,系统是否会出现内存爆炸或灾难性遗忘?
▎120 分钟长视频测试:能否扛住显存压力
单纯看短视频或静态多图的准确率,并不能完全体现流式架构的核心价值。在针对长时序空间感知设计的极限基准VSI-SUPER(包含 10 到 120 分钟的长视频输入)上,全注意力与长视频模型的系统性缺陷暴露无遗。
在VSI-SUPER-Count测试中,传统模型(Qwen3-VL-2B、Cambrian-S-7B 等)在超过 30 分钟后准确率明显下降,到 120 分钟时在 80GB 显卡上出现显存溢出;一些针对长视频优化的基线(MovieChat、Flash-VStream)在计数任务上得分接近 0。
而Spatial-TTT-2B 从 10 分钟到 120 分钟始终保持在 31.8%–45.6% 之间波动,整体保持可用水准,没有出现性能崩溃或显存溢出。
接下来,是真正的压力测试。当视频拉长到几十分钟甚至两小时,会发生什么?(见表 3)。
表3 VSI-SUPER 长视频空间感知结果(10–120 分钟)。
从表 3 中传统模型密集的“0.0 分”可以看出,长程物理感知的瓶颈早已不是简单的精度高低,而是系统架构能否在长时序下存活。这种存活能力的底层支撑,正是其实现了对显存和算力的精细化分配与管理。
▎显存和计算量:从二次方到线性
这种极限抗压能力的背后,是推理期双 KV Cache 机制带来的显存与计算量增长方式的根本改变:
滑动窗口 KV Cache:仅维护固定长度的局部上下文,超出的历史键值对直接丢弃,显存占用恒定;
TTT Pending 缓存:仅作为增量累积单元,一旦达到 Chunk 大小 便触发一次快权重更新,随后立即清空。
这种双 KV Cache 机制带来的硬件友好特性,在 128 至 1024 帧不同长度输入的严苛算力实测中得到了完整的量化验证(见表 4)。
表4 不同输入长度下的峰值显存与计算量对比。
05
结束语:
流式空间记忆的意义和待解问题
Spatial-TTT 的核心价值,在于为多模态大模型在物理场景中的长时序落地,探索出了一条兼顾算力开销与空间记忆的工程路径。
此前,处理多模态长程记忆主要有两种思路:一是直接拉长上下文窗口,但受制于硬件算力与显存瓶颈;二是使用外挂 RAG 或向量数据库,但在连续空间感知中,外部检索容易丢失时序连续性与细粒度几何特征。
Spatial-TTT 验证了第三种可能:将模型部分参数转化为可在线更新的动态记忆体。
面向机器人、智能座舱等端侧设备,受限的算力与显存始终是核心制约。在推理过程中以线性计算开销在线更新快权重、持续保存三维环境信息,为端侧设备处理连续视频流提供了一种更具落地可行性的思路
当然,这条技术路线依然留下了值得深思的前沿课题: 当智能体面对剧烈的光照突变、动态移动的人群或完全未知的开阔室外环境时,在线更新的快权重如何有效防御特征漂移与灾难性遗忘?
从静态三维几何布局的记忆,进一步跨越到高动态的物体位移因果与连续动作序列规划,模型层与优化动力学又该如何继续演进?
这项研究推动了物理空间感知从“离散单帧处理”向“连续流式计算”的转变,也为多模态模型如何高效处理长程物理交互提供了清晰的参考方向。
为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
热门跟贴