自动驾驶在复杂路口该往哪走?传统方案往往只推演一条轨迹,或者先预测环境再决定动作,单向传递。蔚来团队提出的 MM-Future 模型换了个思路:一次生成多组「场景-动作假设」,让车辆轨迹和未来环境共同演化、双向交互。
这项研究由任少卿指导,蔚来团队研发,相关论文已公开发表。它的目标很明确——解决自动驾驶在复杂场景下需要同时处理多种潜在未来结果的问题。
级联式和联合式,卡在哪
按论文的梳理,现有方案大致分两类。级联式是单向传递:先预测未来环境,再据此规划动作,场景和动作之间没有来回。联合式虽然把两者放在一起,但只生成单组结果,等于只押注一种可能。
MM-Future 的不同在于,它能一次性生成多组配对的场景与动作假设。每一组内部,场景和动作继续共同演化。规划时可以参考不同动作可能带来的后果,而不是只盯着一条路走到黑。
三个设计解决三道难题
多模式建模说起来简单,落地要过三关:多样性、计算成本、筛选。
- 多样性:用 Gaussian Mixture Noise 配合 Best-of-Many 监督,解决单结果数据难以产生多种假设的问题。
- 成本:用 MM-Tokens 把视觉特征压缩成紧凑表示,降低计算开销。
- 筛选:用 Future-Conditioned Proposal Scorer 基于配对后的未来,挑出最优轨迹。
这三项设计对应的是同一个逻辑:多组假设不能只是多,还得可控、可算、可挑。
消融实验说明了什么
在 NAVSIM 等基准测试中,MM-Future 表现优异。消融实验给出了更细的结论:增加模式数量、引入联合生成、让评分器读取预测未来,这三项都能提升 PDMS 指标。
另一个值得注意的结果是训练效率。多模式训练的收敛速度明显快于单模式。论文由此认为,多模式联合建模在提升规划指标和训练效率两方面都有效。
换句话说,覆盖多种可能结果并让场景与动作保持双向交互,带来的不是偶然的指标波动,而是稳定的增益。
世界模型开始管后果
这项研究更值得琢磨的地方,在于它对世界模型角色的重新定位。过去世界模型主要做预测——环境接下来会变成什么样。MM-Future 让它承担起动作后果建模的一部分功能:规划的对象从单条轨迹,扩展到动作与未来的联合结果。
自动驾驶不仅能看清周围环境,还能预演多种可能的未来,最终选择最安全的路径执行。这个转变听起来只是措辞变化,实际影响的是整个规划模块的设计范式。
从预测到规划,从单条轨迹到联合结果,MM-Future 给出的答案未必是终局,但它把问题问对了:在复杂场景里,只推演一种未来,本身就不够安全。
热门跟贴