芝能科技出品
世界模型正在成为智能驾驶领域的新一轮高频词。
蔚来有 NWM,华为在 WEWA 架构里加入 World Engine,理想在 VLA Driver 背后搭建云端世界模型;小鹏、地平线以及海外的 Waymo、Wayve 等玩家,也把它放进了各自体系。
这些公司用了相似的名字,技术落点却不相同,只看发布会名称,仿佛都在走同一条路,拆开系统看,区别其实很大。
VLA、世界模型和强化学习,不是三选一
行业里常放在一起讨论的 VLA、世界模型和强化学习,其实不在同一个技术层级。
◎ VLA 解决输入输出问题:车辆怎样把视觉、语言等信息转成驾驶动作。
◎ 世界模型解决环境建模问题:系统能否理解道路中的对象、关系和变化,并预测不同动作带来的后果。
◎ 强化学习是一种训练方法,模型在仿真或闭环环境里行动,再根据评价和奖励调整策略。
三者可以组合,而非三选一。比较不同公司,看点不在它“选了”哪个词,而在世界模型被放在什么位置、承担什么任务、怎样参与最终驾驶能力的形成。沿着这个问题看,蔚来、华为和理想代表了三种不同的系统组合。
蔚来:让世界模型参与能力迭代
2025 年 5 月下旬,蔚来第一版 NWM 开始逐步推送;2026 年 1 月 28 日,新版本向超过 46 万辆搭载 Banyan 系统的车辆推送。
在蔚来体系里,NWM 不只是生成驾驶视频或重建场景,它被放进智驾能力迭代的核心环节,并在训练体系中引入闭环强化学习。
这里的关键是“闭环”。
传统仿真像把提前备好的考题交给系统,看它能不能完成;闭环训练中,模型先作出动作,仿真环境再据此变化,评价系统给反馈、训练系统调策略。
一个行人横穿场景,模型选择加速、减速还是绕行,会带出不同的车辆轨迹与碰撞风险,世界模型得对这些变化作出响应,否则它只是个能播放场景的生成工具,还不是完整的训练环境。
蔚来这条路线的重点,是让 NWM 同时参与环境理解和能力迭代。但仿真闭环做得完整,不等于真实道路能力更强,还取决于场景是否真实、评价是否可靠、虚拟训练能否迁移到现实。
华为:云端建立世界,车端负责行动
华为选择了更明确的系统拆分。
◎ 在 ADS 4 的 WEWA 架构中,WE 是运行在云端的 World Engine;
◎ 车端则由 World Action Model 根据实时环境生成驾驶行为。
云端 World Engine 主要重新组织真实数据、生成复杂训练场景:一段普通道路数据,可以在云端改变车辆位置、参与者行为和场景触发时机,生成切入、急刹、行人横穿等场景,有效场景的密度才是关键,虚拟里程只是附带增长。
2026 年 4 月公布的 ADS 5,架构升级为 WEWA 2.0,引入多智能体博弈和在线强化学习。
多智能体让仿真里的其他车辆不再按固定脚本运动:主车变道,侧后车可能让行也可能加速;主车犹豫,周围参与者也会改变动作。
按华为发布口径,多智能体博弈使训练强度提升十倍,在线强化学习使训练效率提升十倍,这些数字反映华为内部训练体系,不能直接与其他公司的算力或仿真里程横向比较。
华为的特点,是把云端世界、车端行动和训练反馈分成明确模块,再用 WEWA 架构连接起来。
理想:车端以 VLA 为主,云端世界模型负责训练
理想更容易被归入 VLA 路线。
VLA Driver 把视觉、语言和驾驶行为放进同一套模型,不仅识别车辆行人,还要理解车道规则、交通标志和驾驶者的语言指令。
根据公开资料,VLA Driver 背后还有一套自研的重建式与生成式云端统一世界模型,支撑大规模闭环强化学习;2025 年 9 月,VLA Driver 向 AD Max 车型全量推送。
这套体系分前后两段:车端 VLA Driver 理解环境并生成动作,云端世界模型重建和生成场景、让车端模型接受训练和评价。VLA 更接近用户每天接触的车端模型,世界模型则藏在研发训练体系背后。
放大到整个行业,边界正在变得模糊
蔚来、华为和理想之外,其他玩家的路线进一步说明:VLA、世界模型和强化学习正在相互融合,但每家公司融合的方式并不相同。
◎ 小鹏:VLA 本身也被定义成世界模型
小鹏在 2025 年 11 月发布第二代 VLA,走“视觉、隐式表征、动作”路线,去掉显式语言转译,从视觉信号直接出动作。
它对自己的定义很有意思:既是动作生成模型,也是一个能理解和预测物理世界的世界模型。
训练侧,小鹏公布 720 亿参数云端基座、3 万卡集群、接近 1 亿个 clips;2026 年 4 月又发 X-World 技术报告,把生成式世界模型用于 VLA 2.0 的闭环仿真、在线强化学习和模型评价。
按官方数据,仿真场景从一年前 3 万增长到超 50 万,每天模拟里程相当于 3000 万公里真实驾驶。
小鹏的路线说明,当 VLA 开始具备预测未来和理解物理规律的能力,它与世界模型的界限会越来越难划清。
◎ 小米:从数据模仿转向跨领域认知
小米起步晚,迭代跨度反而明显。YU7 的端到端辅助驾驶用 1000 万 clips,主要靠专业驾驶数据学行为;2026 年新一代 SU7 推出 XLA 架构,基于 MiMo-Embodied 基座模型,希望统一辅助驾驶与机器人的认知能力,加强空间理解、物理世界理解和风险预测。
从公开资料看,小米正从“大规模驾驶数据模仿”转向“驾驶与具身智能共用基础模型”。但 XLA 的闭环方式、世界模型结构和量产效果,目前披露得还不够完整。
◎ 地平线:把世界模型做成供应商能力
地平线面对的问题不同:一套技术怎样适配多个品牌、车型和硬件。HSD 采用一段式端到端,同时引入世界模型和强化学习,前者理解和预测场景变化,后者通过环境交互调整行为。
作为方案供应商,它还要考虑算力成本、车型适配、工程交付和规模化量产,这使地平线的世界模型更接近平台能力:不只服务一款车,而在不同车企的数据和产品边界下复用。
◎ 比亚迪:先把车队和数据规模做大
比亚迪的优势首先在车辆规模。截至 2026 年 5 月 28 日,辅助驾驶车型保有量超 315 万辆,天神之眼每天生成超 2 亿公里数据,并将升级物理 AI 大模型、与璇玑架构 2.0 结合。
需要注意的是,“每天 2 亿公里”不等于每天完成 2 亿公里有效闭环训练,也不能直接与其他公司仿真里程相比。
比亚迪提供的是另一条路径:先靠庞大量产车队扩大真实场景入口,再用物理 AI 提高数据利用和生成效率。
对世界模型来说,模型结构决定它能学什么,车辆规模决定它能接触多少真实场景,比亚迪的重点更偏向后者。
海外玩家更重视训练与验证
海外公司里,Waymo 和 Wayve 更明确地把世界模型用于仿真、评价和安全验证。
◎ Waymo 的 Foundation Model 服务于 Driver、Simulator 和 Critic 三部分:Driver 负责驾驶,Simulator 生成闭环环境,Critic 评价结果,内部训练循环再用强化学习改进策略。
◎ Wayve 的 GAIA 系列更接近生成式仿真平台,GAIA-2 生成可控制的多视角驾驶场景,2025 年 12 月的 GAIA-3 进一步把重点放到系统评价和验证上。
两家强调:世界模型的价值不在生成“看起来真实”的视频,而在能否稳定控制场景、复现危险条件、给出可比较的测试结果。
特斯拉的公开表达不同。它没持续把“世界模型”作为 FSD 核心品牌名,更强调真实车队数据、统一模型、训练算力和强化学习。
2026 年披露的 FSD v14.3 升级了强化学习训练阶段,用来处理更多长尾场景,这说明,即使不突出世界模型这个名称,特斯拉也在用真实车队数据和强化学习处理长尾问题。
一家公司的世界模型做到了什么程度?
“世界模型”已经变成边界很宽的行业词,至少可以从四个环节来看它实际走到了哪一步。
◎ 第一,能不能预测动作的后果。只根据历史画面生成下一帧不够,系统要理解车辆加减速转向后,其他参与者会怎样反应。
◎ 第二,能不能持续闭环。生成几秒逼真视频,不等于能让驾驶模型在环境里连续运行、接受评价并修正策略。
◎ 第三,场景能不能控制和复现。真正用于训练的模型,需要能固定道路、天气、车辆行为和危险场景;只有场景可控、结果可重复,版本之间比较才有意义。
◎ 第四,仿真结果能不能迁移到真实道路。这是最难的一步:画面逼真不等于物理关系准确,虚拟高分也不等于真实安全,最终仍要回到量产车的接管率、误判率和碰撞数据。
小结
把这些路线放在一起,一个更清楚的变化是:世界模型正在从环境预测工具,变成智能驾驶的训练基础设施。
整车厂关心它能否改善量产车体验,方案商关心它能否跨车型复用,Robotaxi 公司更关心它能否提供可重复的安全验证。商业模式不同,系统约束也不同,这解释了为什么大家都在讲世界模型,公开指标却很难放在同一张表里比较。
现阶段能够确认的是,车端行动模型、云端生成环境、评价系统和强化学习正在被连接成闭环;尚不能确认的是,哪种闭环带来的真实收益最大。
答案不在仿真里程本身,而在长期道路数据能否证明它减少接管和误判,并降低碰撞风险。
热门跟贴