[首发于智驾最前沿微信公众号]如果一套自动驾驶系统已经积累了150亿公里真实驾驶里程,是否还需要仿真?

就在最近,Momenta披露其量产业务累计真实驾驶里程超过150亿公里,同时每天进行超过1000万公里仿真,并使用强化学习继续训练模型。

为什么已经有那么多真实驾驶里程了,还在不断卷仿真?

不可否认,真实道路已经提供了海量数据,但真实世界里的驾驶场景并不会按照训练需求出现。

越是罕见、危险、难以重复的场景,越难仅靠车辆在现实道路上自然积累,这也是仿真依然重要的原因。

但仿真对自动驾驶的价值,远不止补全罕见场景这么简单。

01

为什么海量真实数据还不够?

真实道路数据始终是自动驾驶训练的重要基础。

车辆在现实环境中采集到的数据,包含道路结构、交通参与者行为、天气和光照变化,以及摄像头、激光雷达等传感器在真实环境下产生的各种信息。

对于端到端模型来说,这些数据还直接关系到模型对场景和驾驶行为的学习。

但真实数据有一个无法回避的问题,就是不同场景出现的频率并不一样。

打开网易新闻 查看精彩图片

图片源自:网络

普通的跟车、直行、转弯很容易积累大量数据,而一些真正考验系统能力的复杂场景,却可能在很长的驾驶里程里只出现很少次数。

尤其是突发横穿、异常变道、特殊道路施工等场景,既难以自然获得足够样本,也不能为了采集数据而人为制造风险。

所以,海量数据并不等于海量有效数据。

Momenta目前公开披露,其量产业务累计真实驾驶里程已经超过150亿公里,并从实际驾驶数据中沉淀出超过1亿段黄金数据。

这里的黄金数据并不是行业统一标准,而是企业对高价值训练数据的定义。

但这至少说明了一点,自动驾驶训练已经不只是简单追求数据规模,还需要从海量数据中持续筛选真正能够推动模型能力提升的样本。

而当这些样本被找出来之后,接下来的问题就是,怎样让模型面对更多类似情况,而不需要继续等待真实道路再次发生。

仿真在这里发挥出了作用。

02

仿真真正补足的是什么?

仿真并不是简单将现实道路复制到电脑里,而是让工程师能够对场景进行重放、修改和扩展。

一个真实采集到的复杂路口,可以保留原有道路结构和交通环境,再改变其他车辆的速度、位置、行驶轨迹或者出现时机,从而得到大量不同的场景变体。

对于已经暴露出问题的场景,这种方式非常有价值,因为工程团队可以针对薄弱环节主动增加训练和测试,而不是继续等待真实道路自然出现。

这也是大规模仿真真正有意义的地方。

Momenta称其目前每天可以进行超过1000万公里仿真。

智驾最前沿以为,这个数字更准确地说是反映了仿真系统的计算吞吐量,而不是每天可以新增1000万公里可直接用于模型训练的有效数据。

不同仿真任务可能包含真实场景重放、场景变体生成、闭环运行以及模型评测等工作,它们的计算价值并不完全一样。

打开网易新闻 查看精彩图片

图片源自:网络

此外,仿真并不是数据生成得越多就越有效。

如果仿真环境中的交通参与者行为过于简单,车辆动力学、传感器特征或者场景变化与真实世界差异较大,模型即使在虚拟环境里训练得很好,当回到真实道路后,也不一定能够保持同样表现。

所以,仿真的核心不是制造更多数据,而是尽可能构造有训练价值、可重复,而且与真实世界足够接近的场景。

这也解释了为什么近年来世界模型开始进入自动驾驶训练体系。

它做的就是从真实数据中直接学习环境演化规律,减少人工建模与真实世界之间的偏差。

03

世界模型和强化学习为什么进入仿真?

传统的数据训练,本质上还是从已有真实样本中学习规律。

世界模型关注的则是环境状态随时间会如何演化。

比如车辆进行了加速、减速或者转向之后,周围车辆会如何变化,行人可能往哪里走,自车下一时刻会处于什么状态。

对于自动驾驶而言,如果仿真环境能够更好地预测这些变化,就可以进一步支持车辆与环境之间的连续交互,而不仅仅是按照提前写好的轨迹播放场景。

Momenta目前公开的技术路线,就是将预训练、闭环仿真和强化学习结合起来,并以世界模型作为统一基础。

其公开资料显示,R7世界模型会利用真实驾驶数据进行训练,同时结合大规模仿真和强化学习继续迭代。

需要说明的是,这属于企业公开披露的技术路线和官方表述,具体能力提升幅度仍然需要更多独立测试验证。

打开网易新闻 查看精彩图片

图片源自:网络

这里的强化学习也很关键。

监督学习更多是在已有驾驶数据中学习人类当时怎么做,而强化学习允许模型在仿真环境中不断尝试不同动作,再根据预先设定的任务目标和约束获得反馈。

这样就可以让一些在现实道路上需要承担风险的试错过程,在虚拟环境中直接完成。

从这个角度看,真实数据、仿真、世界模型和强化学习其实是各司其职,缺一不可。

真实数据负责把模型建立在真实世界之上,并提供现实道路中的驾驶分布;

仿真负责对真实场景进行重放、变体生成和扩展;

世界模型进一步预测环境和车辆行为的变化;

强化学习则利用这种可交互环境探索不同决策。

打开网易新闻 查看精彩图片

图片源自:网络

它们连起来之后,仿真才不再只是一个单纯的测试工具,而开始成为训练闭环的一部分。

这也是为什么,即使真实驾驶数据已经达到百亿公里级别,仿真依然需要继续做的原因。

真实道路能够告诉模型现实世界发生过什么,但现实世界不会按照训练需求,把所有长尾场景都重新演一遍。

仿真提供的价值,就是让工程团队能够围绕这些稀缺场景主动构造、重复验证和持续优化。

所以对于仿真来说,真正值得关注的并不是一天到底能仿真多少公里,而是这些仿真计算到底有没有覆盖模型真正缺失的能力,以及模型在虚拟环境中获得的能力,最终能不能稳定迁移回真实道路。

这也是大规模仿真在自动驾驶训练体系中的真正价值。