目前,端到端自动驾驶正在从模块化感知、预测、规划范式,转向统一的视觉动作模型(Vision-Action Model, VA)或视觉语言动作模型(Vision-Language-Action Model, VLA)。这类模型可以将多摄像头观测、历史状态和车辆轨迹统一编码到 Transformer 模型中,再直接输出未来驾驶轨迹。但自动驾驶中的很多关键决策依赖较长时间范围内的历史信息,例如四向停车路口谁先到达、遮挡车辆是否仍有路权、无保护转弯时对向车是否已经让行。如果直接把 5 秒甚至更长的多帧视觉历史全部送入模型,token 数量会迅速超过实时推理预算。
本文介绍一篇来自 NVIDIA Research 和香港大学等机构联合完成的工作:COMPACT-VA,作者团队提出可一种规划对齐的工作记忆框架,用条件 VQ-VAE 将未来驾驶意图蒸馏成离散 latent,再引导压缩历史视觉token来增强上下文。实验结果表明,在相近 token 预算下,COMPACT-VA 可以在需要长历史记忆的停车控制场景中将 Go Success Rate 提升到 68.3%,同时带来 3.3 倍的推理加速。
论文题目: Planning-aligned Token Compression for Long-Context Autonomous Driving 文章链接: https://arxiv.org/abs/2606.07464一、引言
统一 VA/VLA 自动驾驶模型的结构比较简洁,可以端到端学习从原始多模态输入到驾驶轨迹的映射。例如 Alpamayo[1] 这类模型使用 DINOv2[2] 等视觉编码器处理多摄像头图像,再由统一的 Transformer 进行时序推理和轨迹生成。但这类模型无法显式维护中间状态,历史信息只能以 observation token 的形式保存在上下文窗口中。当场景需要关注更长历史时,token 数会随着时间线性增长,而 Transformer 注意力计算成本又会随 token 数平方增长。
上图展示了一个长上下文的典型场景,在一个全向停车标志的路口,车辆是否应该通行并不只取决于当前帧中看到了哪辆车,还取决于几秒前谁先到达路口。如果压缩策略只保留最近帧,模型可能看不到对方车辆更早到达的证据,从而错误判断自己可以通过。如果只使用规则式压缩手段,模型可能无法理解真实语义。很多压缩策略会保留近期帧、丢弃远期帧,或者按照相似度合并 token,但自动驾驶中的关键信息并不一定是最近出现的。
此外,先前研究常用的位移误差指标不足以衡量自动驾驶决策的正确性。例如,滚动停车可能在 minADE 等轨迹指标上表现不错,但在交通规则上是危险行为。因此本文的实验强调使用 Stop Success Rate、Go Success Rate、Roll-through Rate 等行为指标,可以直接衡量车辆是否做出了正确的停走决策。
二、本文方法
本文方法的核心目标,是在固定 token 预算下为统一 VA 自动驾驶模型构建一组规划对齐的工作记忆。COMPACT-VA 首先使用 Q-former 来压缩长历史视觉 token,再用条件 VQ-VAE 将未来轨迹中的驾驶意图蒸馏为 latent,使压缩模块在端到端训练中学习保留与规划相关的历史线索。
上图展示了 COMPACT-VA 的整体结构。其中,多视角历史观测先送入到视觉编码器生成原始 token,再通过 Q-former 压缩到记忆库中。训练时,后验编码器从未来轨迹中提取驾驶意图,先验编码器则只能从压缩后的历史观测中预测这一意图。最终,压缩记忆和预测出的 latent token 再一起送入到策略 Transformer中,以自回归形式生成未来轨迹。
2.1 使用 Q-former 压缩历史视觉 token
给定 个历史时间步、每个时间步包含 个摄像头、每张图像 个视觉 token,未压缩的视觉 token 数为:
这一数量会随着时间线性增长,为此,COMPACT-VA 先将历史帧组织成 个压缩层,每一层 包含 帧,并使用不同的压缩率 。压缩后的 token 数可以写作:
这种设计本质上是一种分层工作记忆,即最近帧保留更多的 token,用来捕捉当前的交互状态。较远帧则使用强压缩,只保留对决策有价值的线索。具体而言,在每一层压缩时,模型把可学习 query token 与原始观测 token、时间步嵌入、摄像头嵌入和历史轨迹信息拼接,通过类似 BLIP-2 中 Q-former[3] 的注意力模块聚合视觉特征。压缩后的 token 会按时间顺序重新排列,并注入按压缩率调整后的 RoPE 位置编码,来使不同压缩层的时间位置仍能对齐。
2.2 用未来轨迹蒸馏驾驶意图 latent
仅靠Q-former压缩仍然无法保证模型保留的是真正有用的信息。为了解决这一问题,COMPACT-VA 进一步引入了条件 VQ-VAE。它包含一个训练时使用的后验编码器 ,以及一个训练和推理都使用的先验编码器 。
其中,后验编码器可以访问未来轨迹,因此它负责从真实未来行为中提取驾驶意图。本文先将未来轨迹转成加速度和曲率控制序列,再量化为离散轨迹 token,随后通过一个轻量的 Transformer 输出高斯分布参数,并采样得到 。先验编码器则只能访问压缩后的历史观测 ,来预测驾驶意图 latent。这就形成了一个关键约束:如果压缩模块丢掉了决定未来行为的历史线索,先验编码器就无法预测出与后验一致的驾驶意图。
在此基础上, 和 会被映射到共享 VQ codebook 中,来得到离散的 skills 表示 。随后,这个离散 latent 被重新投影为一个特殊 token,和压缩记忆一起送入到策略 Transformer 中来输出驾驶意图token。
2.3 端到端训练压缩和轨迹预测
基于上述设计,COMPACT-VA 的训练目标由三部分组成,形式化表示如下:
其中 是未来轨迹 token 的交叉熵损失,KL 项要求先验编码器从压缩历史中预测出接近后验的驾驶意图,commitment loss 用于稳定 VQ-VAE。该损失函数将压缩、意图预测和规划放到同一个闭环中进行优化。在推理阶段,后验编码器会直接丢弃。系统只保留 Q-former 压缩模块、先验编码器、VQ-VAE 和策略 Transformer。模型需要完全根据历史观测预测驾驶意图,并输出未来轨迹,这保证了训练和部署的一致性。
三、实验结果
本文作者在 Alpamayo Physical AI 数据集上构建了与停车控制相关的长历史评估集,并在 Alpasim 仿真环境中测试模型的驾驶能力。
上图展示了本文重点关注的三类多信号动态场景。它们共同的特点是,正确行为并不只取决于当前帧的几何位置,而需要模型记忆并理解前几秒出现过的车辆状态、路权关系或对向车的运动趋势。
3.1 COMPACT-VA 在停车控制场景中的性能
作者首先在四向停车、动态遮挡、无保护转弯等多信号场景中对比不同上下文方法的性能。评价指标包括 Go Success Rate、Stop Success Rate、Roll-through Rate、停车位置误差和停车时长误差。
上表结果显示,标准 Alpamayo 在 1 秒、8 张图像输入的条件下,Go Success Rate 为 63.8%。当直接扩展到 5 秒长历史时,如果只进行稀疏采样,Go Success Rate 下降到 62.0%。如果保留 40 张图像的密集长历史但不压缩,Go Success Rate 也只有 61.9%。这说明更长的上下文并不会直接提升决策质量,并且增加过多未经组织的 token 反而会干扰模型进行时序推理。
3.2 长历史压缩可以有效提升自动驾驶决策效率
为了验证本文方法不是只在数值指标上有效,作者进一步在 Alpasim 环境中进行了 910 个多样化场景的闭环评估。该实验主要用于确认 COMPACT-VA 在一般驾驶场景中不会破坏安全性和轨迹质量。
上表结果显示,COMPACT-VA 在碰撞、越界、错误车道、规划偏差等闭环指标上与基线方法基本持平。这说明压缩长历史并没有牺牲模型在一般驾驶场景中的稳定性。
在推理效率方面,短上下文基线方法的平均推理时间为 498.50 ms,峰值显存为 5.94 GB。未压缩长上下文方法的平均推理时间为 1253.52 ms,峰值显存为 10.51 GB。COMPACT-VA 在 5 秒、40 张图像输入的情况下平均推理时间为 377.08 ms,峰值显存为 3.95 GB。相对未压缩长上下文方法,本文方法实现了 3.3 倍的推理加速和 2.7 倍的显存降低,这展示了 COMPACT-VA 的推理效率优势。
3.3 历史记忆对自动驾驶决策的影响
除了定量实验,作者还给出了一个全向停车标志场景下右转的闭环案例,用来直观展示 COMPACT-VA 如何利用历史上下文做出让行判断。
在上图中,车辆需要在路口右转,同时让行给更早到达并继续直行的交叉车辆。鸟瞰图里的黄色轨迹表示参考轨迹,蓝色轨迹表示模型给出的预测轨迹,两者都保持较短,说明模型选择减速并等待,而不是直接穿过路口。右侧的相机视角则展示了车辆减速、对向车辆通过的过程。该例子可以说明,COMPACT-VA 保留的并不是任意历史画面,而是能帮助判断路权和车辆到达顺序的关键线索。
3.4 消融实验
作者也进一步对模型的架构组件进行了消融,在无压缩情况下,输入 5 秒 40 张图像的 Go Success Rate 只有 61.9%。加入朴素压缩后性能提升到 63.5%。加入历史轨迹条件的压缩后性能达到 65.6%。
上表结果说明,性能提升来自多个组件的叠加。其中,Q-former 压缩减少了冗余 token 数量,历史轨迹条件可以帮助模型聚焦自身行为的相关信息,规划对齐 latent 则进一步把压缩目标绑定到未来驾驶决策上。
上表展示的压缩率消融实验也给出了一个重要结论:最近帧应当保留较高的分辨率,远期帧则可以进行更强的压缩。当最近层保留 8 张图像、每张 160 token,并对中远期帧进行分层压缩时,模型可以获得最好的 Go Success Rate 性能。
四、总结
本文提出的 COMPACT-VA,为长上下文自动驾驶提供了一种规划对齐的 token 压缩方案。它通过 Q-former 模型来建立一种高效的工作记忆,再用条件 VQ-VAE 从未来轨迹中蒸馏驾驶意图,让压缩过程直接作用于轨迹预测和停走决策。实验结果表明,COMPACT-VA 可以在停车控制等关键场景中显著提升 Go Success Rate,并能在闭环仿真中较好地保持一般驾驶能力,同时带来明显的推理加速和显存节省效果。
参考
[1] Wang Y, Luo W, Bai J, et al. Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail. arXiv, 2025.
[2] Oquab M, Darcet T, Moutakanni T, et al. DINOv2: Learning Robust Visual Features without Supervision. Transactions on Machine Learning Research, 2024.
[3] Li J, Li D, Xiong C, Hoi S. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. International Conference on Machine Learning, 2023.
Illustration From IconScout By IconScout Store
-The End-
本周上新!
扫码观看!
“AI技术流”原创投稿计划
TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线700+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。
投稿内容
// 最新技术解读/系统性知识分享 //
// 前沿资讯解说/心得经历讲述 //
投稿须知
稿件需要为原创文章,并标明作者信息。
我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励
投稿方式
发送邮件到
yimingzhang@thejiangmen.com
或添加工作人员微信(aceyiming)投稿,沟通投稿详情
关于我“门”
将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。
将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。
如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:
bp@thejiangmen.com
点击右上角,把文章分享到朋友圈
热门跟贴