近日,千里科技(AFARI)旗下 World Model Team 发布自动驾驶世界模型新成果 BehaviorWorldGen。据官方资料,该框架主要针对现有自动驾驶世界模拟器中“周围车辆无法根据自车行为作出真实响应”的问题,引入可控的车辆行为生成机制,使仿真环境中的交通参与者能够进行更接近真实道路的交互。

打开网易新闻 查看精彩图片

随着端到端、VLA 等技术路线不断演进,利用世界模型生成训练数据,已经成为自动驾驶模型训练的重要方向。不过,现有模拟器仍存在一个明显的问题:很多系统主要根据自车动作生成后续场景,周围车辆往往只是回放历史轨迹,或作为生成画面的一部分出现,并不会真正“回应”自车。

打开网易新闻 查看精彩图片

这会导致仿真与真实道路之间出现偏差。例如,自车进行一次较为激进的变道,在真实道路中可能导致后车减速、避让甚至引发冲突,但在缺乏车辆交互能力的模拟环境中,这条轨迹可能依然被判断为安全。同时,加塞、让行、路口博弈等复杂长尾场景本身出现频率较低,也更难通过传统数据采集方式获得足够样本。

打开网易新闻 查看精彩图片

为此,BehaviorWorldGen 引入了核心模块 BehaviorFlow。其思路是给不同车辆加入可解释的帧级“元动作”,包括保持车道、变道、转弯、掉头、旁路等行为,从而控制交通参与者在不同时间节点的行为。与此同时,其他车辆也会根据当前交通状态生成相应反应,使整个场景形成多车之间的交互关系。

从更完整的训练流程来看,系统可以首先识别动作模型表现较差的场景,例如碰撞、不安全车距以及让行失败等,再针对这些问题生成相应的复杂交互场景,随后将场景进一步渲染为多视角 RGB 画面和 LiDAR 数据,并重新加入训练集。也就是说,相比单纯增加更多数据,这套框架更强调围绕模型的薄弱场景进行针对性补充。

在世界模型部分,团队基于 Diffusion Transformer 构建动作条件世界模型,并通过少步蒸馏、因果模型训练等方式提升生成效率。论文数据显示,因果模型推理速度由双向模型约 20 秒/帧缩短至0.3秒/帧,提升接近70倍,FID 指标则从 6.72 改善至 4.36,同时支持最长约30秒的自回归场景生成。

打开网易新闻 查看精彩图片

在动作模型验证方面,研究团队分别在 ChainFlow-VLA、ReCogDrive 和 DiffusionDrive 三类模型上加入 BehaviorWorldGen 生成的数据。

打开网易新闻 查看精彩图片

其中,ChainFlow-VLA 在 NAVSIM 基准中的 PDMS 从 93.1 提升至 93.3;ReCogDrive 从 86.5 提升至 87.3;DiffusionDrive 则从 87.7 提升至 88.6。更值得关注的是,在原始 DiffusionDrive 表现最差、PDMS 低于0.15的困难场景中,原模型评分为0,加入 BehaviorWorldGen 数据后提升至 34.8。

打开网易新闻 查看精彩图片

除了车辆交互生成外,BehaviorWorldGen 还支持稀有物体插入、雾度控制、雨雪及夜间天气迁移,以及车辆轨迹编辑等能力;同时通过生成多视图画面和 LiDAR 点云,扩展3D高斯溅射重建式模拟器原本受限的观测范围。

从这项研究来看,世界模型在自动驾驶领域的竞争重点正在从单纯追求“画面生成得像不像”,进一步转向交通参与者之间的行为逻辑是否真实。对于自动驾驶训练而言,如果模拟器能够主动制造加塞、抢行、避让等低频但高价值的复杂场景,并根据模型失败案例持续生成针对性数据,那么虚拟仿真也有机会从数据补充工具,逐渐成为模型持续训练和迭代的一部分。