打开网易新闻 查看精彩图片

2026年的智能驾驶行业,弥漫着一种微妙的气息。

如果以两年为周期回望,2024年还是“端到端”取代模块化架构的颠覆之年,彼时,谁能率先将感知、规划、控制揉进一张神经网络,谁就握住了通往高阶智驾的门票。但到了2026年中,单纯的端到端已经不够看了。行业里最前沿的讨论,早已从“是不是端到端”转向了“端到端之上,如何理解世界”。

在此基础上出现的物理AI和世界模型成了讨论热度最高的两种技术路线。

打开网易新闻 查看精彩图片

世界模型不直接输出动作,而是先在内部模拟未来几秒世界会怎么演化,再从中选最优路径。“物理AI” 概念则更宽泛,强调的是让AI系统理解重力、惯性、因果关系这些物理规律。

2026年北京车展上,“物理AI”的话题热度甚至超过了激光雷达数量和芯片算力,成为头部车企和智驾方案商们共同喊出的口号。

端到端大模型、VLA、世界模型、物理AI,这些概念在2026年的行业讨论中频繁交替出现,有时彼此重叠,有时各说各话。它们之间到底是什么关系?竞争、互补,还是殊途同归?世界模型和物理AI到底有可能成为智驾的新底层架构?

端到端的胜利与局限性

先看端到端大模型,端到端一直被称为智能驾驶底层架构的主流路线。

2024年初,特斯拉FSD V12把规则代码从30万行砍到3000行,感知-决策-控制全部交给一个神经网络。这是端到端在量产车上的第一次落地,也是整个行业的认知拐点。

此后的两年里,端到端架构以惊人的速度普及。理想、小鹏、蔚来、华为、比亚迪、吉利……几乎所有头部玩家都把端到端作为基础框架。到2026年北京车展,如果你说自己的智驾系统不是端到端架构,基本等同于承认自己不在牌桌上。

端到端的核心逻辑极其简洁:摄像头像素输入,方向盘转角输出,中间没有人工定义的模块边界。通过海量人类驾驶数据训练,模型自主学习从感知到控制的完整映射。

打开网易新闻 查看精彩图片

这套架构的优势显而易见。它绕开了传统模块化架构中感知-规划-控制的级联误差,让整个系统端到端地优化,也让智驾体验的平顺度实现了质的飞跃,不再有模块边界处的生硬切换以及规则冲突导致的急刹。

但端到端的问题也同样清晰。

第一,它本质上是一个模仿学习系统。它学习的是人类怎么开,而不是为什么这么开。面对训练数据中从未出现的长尾场景,它的表现会急剧退化。用行业里的话说:它是见过才会,不是懂了就会。

第二,它缺乏对物理世界的理解。端到端模型不知道路面湿滑意味着制动距离延长,不知道树枝悬空可能掉落,不知道积水下面可能藏着深坑。它可以通过大量的数据拟合出一些表面规律,但无法建立因果推理的能力。

第三,它的可解释性几乎为零。当端到端系统做出一个决策,工程师很难解释它为什么这么做,这在L3/L4的合规和安全认证中是一个致命问题。

正是因为这些局限,行业开始寻找端到端之外的可能性。世界模型和物理AI就是在这样的背景下进入主流视野的。

世界模型:新底层架构

还是高端仿真器?

世界模型或许是智能驾驶底层架构路线中最具技术想象力的分支。

它的核心思想是构建一个能够理解物理世界运行规律的神经网络,使其能够根据当前状态预测未来状态的演化。当你给它一个场景和一组动作,它能生成下一秒、下五秒、下十秒的世界会变成什么样。

这听起来很像科幻,但2026年它已经在量产车上跑了。

华为的WEWA 2.0架构是最典型的代表。云端部署世界引擎(World Engine),通过扩散生成模型在虚拟空间中生成高密度极限场景,难例密度相比真实世界提高1000倍;车端部署世界行为模型(World Action Model),从多模态感知输入出发做实时决策。这套架构预计在2026年搭载超过80款车型。

打开网易新闻 查看精彩图片

Momenta的R7世界模型则采用了“预训练-仿真-强化学习”三层架构。基于超过120亿公里真实驾驶里程提炼出约1亿段黄金数据,将物理规律、常识与因果关系压缩进模型,以此为基础构建高保真虚拟训练场,让系统在接近真实的环境中反复探索与试错。

蔚来的NWM(NIO World Model)走得更激进。它能在100毫秒内推演216种潜在场景演变,并从中筛选最优路径。2026年初,蔚来将世界模型、闭环强化学习架构全量推送至数十万辆车型,三个月内城区领航辅助的使用里程和时长环比分别提升了92%和116%。

打开网易新闻 查看精彩图片

特斯拉则在2026年1月公开了其神经世界模拟器专利,基于自建海量数据集训练,能够根据当前状态与下一步动作生成未来状态,让AI在一天内学习相当于人类500年的驾驶经验。

这些落地案例说明,世界模型已经不是实验室里的玩具。它是真实的、在跑的、有数据的。

但世界模型真的能成为智能驾驶的新底层架构吗?这里有三个关键问题需要回答。

第一,世界模型是辅助还是替代?目前所有量产方案中,世界模型扮演的都是辅助角色。它负责云端仿真、数据增强、安全评估,而不是替代车端的实时推理架构。换句话说,世界模型更像是AI驾校。它让端到端模型在部署之前接受了更充分的训练,但车辆在实际行驶中的决策链路,本质上还是端到端或VLA架构。

打开网易新闻 查看精彩图片

第二,世界模型的推演精度够不够?在虚拟世界中推演未来5—10秒的场景演变,听起来很美好。但物理世界的高度复杂性意味着,任何模型对未来的预测都会随着时间衰减。一个0.1%的预测误差在连续的推演中会被指数级放大。当前的方案普遍用“多轨迹采样+安全兜底”来应对这个问题,但这本身就说明世界模型的单独推理还不足以作为安全决策的唯一依据。

第三,世界模型和大语言模型的本质区别是什么?大语言模型之所以能成为AI领域的革命性基础设施,是因为它找到了一个统一的、可扩展的预训练范式,在万亿token的文本数据上做下一词预测。世界模型试图复刻这个范式,在万亿帧的视频数据上做下一帧预测。但物理世界的建模远比语言建模复杂:文本是离散的、符号化的,而物理世界是连续的、高维的、充满不确定性的。世界模型能否复刻大语言模型的成功路径,目前还没有答案。

目前,世界模型是端到端架构的关键补充和强力助推器,但至少在2026年,它还不足以独立成为智驾的底层架构。它更像是为端到端系统配备了一个物理常识引擎,而不是取而代之。

物理AI:智驾技术新贵

物理AI这个词在2026年的出现频率堪比2023年的大模型,像一个势头旺盛的技术新贵。

小鹏明确宣告向物理AI科技公司转型。蔚来重组组织架构,成立大模型部集中研发NIO World Model。理想复盘三代技术路线后,坚定锚定VLA方向。Momenta CEO曹旭东直接把公司定位为物理AI基座模型的构建者。

但物理AI到底是什么?

如果只用一句话概括:物理AI是让机器理解重力、惯性、因果关系等物理规律,从而真正参与到真实世界的运行之中。它区别于数字AI(如大语言模型)的核心在于,数字AI处理的是符号和文本,物理AI处理的是三维空间中的物体运动和交互。

Gartner已经将物理AI列为2026年十大战略技术趋势之一。这个判断的背后是一个基本共识:仅仅依靠感知和模仿,自动驾驶永远无法突破L3/L4的天花板。

打开网易新闻 查看精彩图片

物理AI的具体落地形态目前分化出了两条路线。

第一条是外挂微调路线。以通用大语言模型为底座,往上堆驾驶数据做后训练和微调。这条路成本低、见效快,可以快速抢占市场。但天花板也很明显:底层模型对物理世界的理解能力先天不足,缺乏对三维空间、时间序列和车辆动力学的深刻认知。有工程师打了个比方:这就像让一个博览群书的文科生去开赛车。他可以背诵所有的交规和驾驶手册,但面对真实的物理世界,他缺乏肌肉记忆。

第二条是原生基座路线。在基座模型预训练阶段就把通用语料与智驾数据深度融合,让模型从一出生就懂行。千里科技与阶跃星辰的合作就是典型案例,打造原生的智驾基座模型,天生具备对物理世界的理解力。理想汽车的MindVLA-o1也走这条路:采用原生多模态MoE Transformer架构,在同一个模型框架内统一感知、推理和决策。

今年4月,吉利正式发布了舱驾融合超级智能体——超级Eva,并在极氪8X上实现全球首发量产。将原生大模型的理解能力与自研语音工程、车端控制深度结合,超级Eva的思考能够瞬时转化为安全的物理控车动作。这就是物理AI落地的一个典型案例。

三国归晋?

路线的融合与分野

如果你留意各家的技术表述,会发现一个有意思的现象:没有人真的选择纯端到端或纯世界模型。技术路线的融合已经成为一种新的趋势。

理想的MindVLA-o1在VLA框架内引入了预测式隐世界模型。小鹏的第二代VLA被官方同时定义为动作生成模型和理解和推演的物理世界模型。小米的XLA认知大模型明确宣称融合了VLA和世界模型架构。华为的WEWA本身就是“云端世界引擎+车端世界行为模型”的组合。

行业正在形成一个新的共识:VLA负责感知当前环境、理解语义、决定下一步动作;世界模型负责推演未来5到10秒场景会如何演变。两者不是替代关系,而是互补关系。

打开网易新闻 查看精彩图片

这种融合趋势其实指向了一个更深刻的判断:智能驾驶的终极架构不会是单一模型,而是一个多模型协同的系统。就像人类驾驶同时依赖直觉(小脑)、推理(大脑皮层)和物理直觉(身体经验)一样,未来的智驾系统也需要多种能力的组合。

因此,选边站队没有意义。无论是端到端、VLA还是世界模型,最终都会融入同一个技术体系。真正拉开差距的是技术深度和工程落地能力。架构之争的终局取决于谁能第一个跑通从理解到推演到决策的完整闭环。端到端解决了怎么做,VLA加入了为什么这么做,世界模型补充了接下来会发生什么。

回到开头的问题:物理AI和世界模型到底是智驾的新底层架构,还是蹭AI基础模型的热点?

它们是真实的、必要的技术升级方向,但还不构成独立的底层架构。更准确的描述是,它们正在重塑端到端架构的上限,而不是取代端到端架构本身。

端到端是骨架,提供了从感知到控制的端到端优化能力。物理AI是肌肉,让系统理解重力、惯性、因果关系。世界模型是预演系统,让系统在行动之前推演后果。

打开网易新闻 查看精彩图片