打开网易新闻 查看精彩图片

论文的团队来自于清华大学产业研究院(AIR),滴滴,北京航空航天大学。团队近年在自动驾驶与具身智能领域发表论文数十篇,并和国内外知名高校、科研机构广泛开展合作。

该论文的第一作者为杨予光,北京航空航天大学博士研究生,研究方向为自动驾驶与具身智能,提出首个 MLLM 原生自动驾驶模型 CuriousVLA,也是当前自动驾驶领先模型 CLOVER 的重要贡献者。迄今已在 ICLR、NeurIPS、CVPR、ICCV、ECCV 等顶级会议发表论文 7 篇,长期担任相关顶会审稿人,并获 CCF 中国计算机学会年度应用奖励。

本文主要介绍来自该团队的最新论文 Teaching Vision-Language-Action Models What to See and Where to Look,目前该论文已经被 ECCV 2026 正式接收,相关代码和模型已全部开源。

该工作聚焦于自动驾驶场景中的自回归型 VLA 模型的训练,主要的观点是现有 VLA 的交通相关数据在很大程度上依赖以文本为中心的视觉问答和思维链推理数据,这类数据更强调语言推理,而非基于动作的规划。为解决这一问题,该工作提出利用交通要素蒸馏的方式纠正 VLA 模型的关注要素,使其更加关注视觉要素;同时,该工作还提出了一种将 BEV 轨迹映射到图像像素空间进行学习的技术,这能够充分利用基模已有的视觉能力,使轨迹内在的空间含义对模型更加可理解。DriveTeach-VLA 在 NAVSIM 上进行了评测,达到 90.4 的 PDMS;在进一步运用 Drivor 轨迹选择器后 PDMS 可以提升至 92.7,取得了当前最先进的性能。

打开网易新闻 查看精彩图片

  • 论文题目:Teaching Vision-Language-Action Models What to See and Where to Look
  • 合作机构:北京航空航天大学,清华产业研究院,滴滴,中国传媒大学
  • 论文链接:https://arxiv.org/pdf/2607.01658
  • 项目主页:https://github.com/ShivaTeam/DriveTeach-VLA

研究背景与挑战:自动驾驶模型无法从互联网预训练中获益

设想一个并不罕见的情景:自车准备左转,右侧有行人靠近斑马线,前方的大车遮住了部分视野。得益于多模态基模在互联网数据中习得的强大预训练能力,如今视觉 — 语言 — 动作模型(VLA)已经能把这种场景的应对措施描述得很好:应该减速、观察、礼让行人,然后再左转。但是,这种大语言模型均具备的能力,真的能决定车辆驾驶与控制的安全吗?真正决定安全的,是模型生成轨迹时究竟看向了哪里:它有没有盯住行人?有没有理解被遮挡区域?所谓 “左转”,又是否对应到画面中那条真实可行驶的车道?

论文通过几个例子非常直观展示了这种机制的必要性,下图 (a) 是一个常见的 VLA 模型基线,使用 Qwen2.5-VL 适配自动驾驶数据,结果模型的关注点是非常分散的分布在图上,并没有明确的注意力焦点。论文分析这种注意力失焦的问题主要是由于现在的 VLA 训练实际上是在把大语言模型当作一个大的拟合器在用,VLA 只是独立的学习如何根据场景输出对应的思维链和给出对应的轨迹,并没有真正 “明白” 思维链与轨迹预测之间的关系。

打开网易新闻 查看精彩图片

DriveTeach-VLA 清华北航团队认为,VQA 和思维链可以教模型理解交通语义,却不能自动保证语言推理与控制所对应的规划空间是一致的。因此,该论文的思路是,让模型学习如何在轨迹推理的时候关注那些语言推理中涉及到的视觉要素,从而最后影响车辆轨迹的生成。简单说,就是先教模型哪些地方值得关注,再教它接下来应该看哪里,从而引导模型把注意力聚焦于车道,行人,红绿灯等与交通规则密切相关的位置。

具体来说,DriveTeach-VLA 没有继续堆叠更长的思维链解释文本,而是把视觉 - 语言 - 动作训练拆成三件更具体的事:先教模型识别什么值得看(learns what to see),再告诉它未来应该看向哪里(learns where to look),最后校正它怎么开(learns how to drive)。

第一课:把交通常识教进视觉编码器(What to See,DVD Pretraining)

VLA 之所以运用多模态大模型作为基座,是因为在预训练过程中见过海量的图片可以提供大量的世界先验知识。但是,在具体的自动驾驶场景中,路边广告牌和正在横穿的行人,对下一秒轨迹的重要性完全不同。因此,DriveTeach-VLA 设计了驾驶知识驱动的视觉蒸馏方法( Driving-aware Vision Distillation,DVD)。

训练时,首先由 GroundingDINO 先标出车辆、行人、路障和交通灯等关键对象;论文希望 VLA 能够尽可能多的关注这些关键对象,为此,论文参考了牛津大学视觉几何组(VGG)对CLIP的视觉提示研究工作,只要在图像上用明显的视觉标识标记物体,就能直接改变模型的注意力。为此,运用了自蒸馏的思想,将 VLA 基座的 ViT 拷贝为学生 ViT 和教师 ViT,由 GroundingDINO 标注出的 bbox 框标注在图像上,输入给教师 ViT,而学生 ViT 只读原图。

教师 ViT 由于受到 bbox 框标注的引导,注意力会自然偏向于那些被标记的交通要素,而学生 ViT 则直接学习这些被注意力矫正后的特征。这样一来,教师所拥有的 “交通对象提示”,可以通过蒸馏算法迁移给学生。在蒸馏方式方面,论文使用的则是类似 Swin Transformer 的块级感知蒸馏,也就是将特征图先分块后再平均池化,这样尽可能多的获取到由框矫正带来的特征变化。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

论文还进一步尝试给 GroundingDINO 输出的标注框通过随机丢弃(Random drop)和框扰动(Jitter bbox)检验由 GroundingDINO 这种预标注带来的性能增益是否稳定。实验结果显示出 DVD 能带来约 1.4 的 PDMS 改善,而且在增加了 20% 的噪声后,DVD 依然能带来良好的性能增益。

打开网易新闻 查看精彩图片

第二课:在画面里指出 “未来要走的地方”(Where to Look,2D-TGP 图像轨迹)

论文还从基座预训练的角度给出了一个见解,认为现在大家将多模态模型基座想象成了在自驾领域需要从头开始学习的模型。但实际上,多模态模型基座受益于预训练时大量的数据,对于交通、路况等场景的理解能力的适配是很容易学习的。而真正的瓶颈在于自动驾驶规划通常在鸟瞰(Bird-Eye-View,BEV)坐标系中输出轨迹,这种轨迹的含义对于基模而言是难以被直接理解的。

为此,DriveTeach-VLA 引入 2D Trajectory-Guided Prompt(2D-TGP):利用相机内外参,把专家驾驶轨迹从 BEV 坐标系投影到图像平面上,得到一串像素坐标;随后再把这些像素坐标组织成文本形式,作为提示输入给 VLA 模型。这样一来,模型看到的不再只是 “左转” 这种语义指令,而是同时获得了一个更具体的视觉参照:未来轨迹大致应该经过图像中的哪些位置。而幸运的是,多模态基模在预训练时已经习得了很好的读图能力,2D-TGP 则通过图像轨迹的方式直接关联了规划空间与多模态基模的读图能力。

打开网易新闻 查看精彩图片

例如下图,“向左转” 这一条语义指令,能够被 2D-TGP 转化为标注在图像上的一串可被大模型直接理解的 2D 图像指标。

打开网易新闻 查看精彩图片

在系统设计上,DriveTeach-VLA 使用了两个 Qwen2.5-VL-3B 模型进行分工。第一个模型是 TGP-Prompter,负责根据当前图像、车辆状态和驾驶指令,先预测图像平面上的 2D-TGP;第二个模型是 TGP-Planner,它再结合图像、车辆状态、驾驶指令以及这个 2D-TGP 提示,生成最终的 BEV 轨迹。

打开网易新闻 查看精彩图片

这里的训练方式也值得注意。受启发于基模 “下一个 token” 预测的 teacher-forcing 范式,在训练 Planner 时,论文使用的是真值 2D-TGP,也就是由专家轨迹投影得到的标准提示;但在推理阶段,Planner 拿到的则是 TGP-Prompter 自己预测出来的 2D-TGP。

打开网易新闻 查看精彩图片

不过,这就带来了一个自然的问题:训练时模型看到的是相对准确的轨迹提示,测试时却要依赖另一个模型预测出来的提示,两者之间可能存在 teacher forcing 导致的训练 — 测试差距。作者对此特别进行了验证,整体上看图像轨迹是能被较为准确的预测的,同时图像轨迹的质量尽管对于最终的 BEV 轨迹预测起着关键作用,但是整体的性能也不会因为图像轨迹的略微误差而导致崩溃,这展示了图像轨迹作为一种良好的中间表示的重要性。

打开网易新闻 查看精彩图片

实验结果:消融,NAVSIM,nuScene

论文对 DVD 和 2D-TGP 进行了非常细致的消融验证。Qwen2.5-VL-3B 基线为 84.8 PDMS;加入 VQA 与 CoT 后升至 86.4,说明语言监督确实有用。继续加入 DVD 后达到 87.3,加入 2D-TGP 后为 88.2;再经过 GRPO 行为对齐,完整系统单次推理达到 90.4 PDMS、85.4 EPDMS。

打开网易新闻 查看精彩图片

另一个容易被忽略的细节是,DriveTeach-VLA 的提升并非简单地来自模型规模。实验所用的 Planner 仍是 3B 级的,因此主要变化发生在监督方式和中间接口上。当模型已经具备基本语言推理能力时,继续增加文本未必是最高效的;更直接的空间监督,可能比 “让模型多想几步” 更接近规划的瓶颈。作者报告了他们在 NAVSIM 和 nuScene 的结果,均超过了已有的 SoTA VLA 模型。其中 NAVSIM 的 PDMS 达到 90.4,而 nuScene 的 L2 误差仅为 0.3。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

另外,DriveTeach-VLA 作为一个没有引入扩散或者连续 MLP 映射层,仅依靠基模自身能力进行推理的 VLA 模型,还继承了大语言模型由采样带来的优良性质,如果允许每个场景生成 12 条候选轨迹,再由 DrivorR 选择器挑选,结果可提升到 92.7 PDMS、89.0 EPDMS。尽管在实际运行中不能这样做,但是这意味着后续的研究者可以通过例如模型蒸馏的方式,进一步提升模型的性能上限。

打开网易新闻 查看精彩图片

总结

DriveTeach-VLA 最有价值的地方,不仅仅是其更好的 NAVSIM 跑分,而是论文发现了一种能够有效地将 BEV 轨迹与基模原先的识图能力进行直接关联的桥梁,这意味着对于大规模 VLA 训练所依赖的数据可以进一步降低,模型通过这种方式能够直接理解到 BEV 轨迹内在的空间含义。如果再把它和作者的前作 CuriousVLA 放在一起看,这条思路会更清楚。CuriousVLA 强调的是纯多模态大模型路线:不额外引入扩散式动作头,而是尽量依靠自回归推理完成驾驶决策。因此,这两项工作合起来,其实给出了一种 VLA scaling 的蓝图:用多模态基座承担场景理解和推理,用显式空间提示把 BEV 轨迹接回图像空间,最终通过自回归推理的方式实现多模态大模型在大规模自动驾驶数据上的 scaling。