打开网易新闻 查看精彩图片

文|万湑龙

2025年11月5日,小鹏在广州办了第七届科技日。

何小鹏在台上宣布,小鹏的定位从“未来出行探索者”升级为“物理AI世界的出行探索者,面向全球的具身智能公司”。同一场发布会,他一次摆出了四样东西:第二代VLA大模型、Robotaxi、全新一代人形机器人IRON,还有汇天的飞行汽车。

从那天起,“物理AI”成了这家公司的旗号。今年4月1日,“小鹏汽车”正式改叫“小鹏集团”,名字里拿掉了“汽车”。再往后,第二代VLA在3月推送上车,8月机器人业务拿下超9亿美元融资。一路走到8月27日这场叫“TIME 时间”的活动,小鹏给第二代VLA做了一次重大升级。

这次升级的主题只有一个词:时间。去年科技日发布的第二代VLA,解决了机器“看见世界、做出动作”的问题;而这一次,它要解决的是“理解世界在流动”的问题。这一步有多重要?说白了,一个只看得见眼前、记不住刚才的司机,永远算不上会开车。

为什么“看懂时间”这么难

先把时间拨回2023年。

那一年7月,谷歌DeepMind发布了一个叫RT-2的模型,第一次把“视觉、语言、动作”缝进同一个大脑,学术圈管它叫VLA。几乎同一时期,特斯拉把端到端的自动驾驶推上车,何小鹏第二年6月专门飞到旧金山去试了一版FSD,回来还在微博上找马斯克借更新的内测版。那时候信的人不多,但方向已经变了。

要理解小鹏这次做的事,得先知道智驾这门手艺是怎么一步步走到今天的。最早的一代,靠工程师写规则,红灯停、绿灯行、车道线里走,一条一条if-else堆出来。它的毛病摆在明面上:真实世界的路况比规则本厚得多,规则永远写不完。于是有了端到端,把感知和决策塞进同一个神经网络,信息不再在模块之间传来传去地损耗。再往后,是为了补上“可解释”这个洞,把语言塞进来,才有了VLA。

打开网易新闻 查看精彩图片

麦吉尔大学、清华、小米那批人合写的一篇综述,把VLA的演进切成了四段:Pre-VLA、模块化VLA、端到端VLA,再到增强型VLA。国内能打的,理想在做MindVLA,元戎启行、华为、蔚来也各自押了路线。按华金证券的梳理,特斯拉、地平线、Momenta走端到端,理想、小鹏、元戎启行做VLA,蔚来、华为、吉利则在试世界模型。三条路,最终都指向同一个终点:让车学会预测。可有一条,谁都没绕过去:不管模型多大,它看到的世界始终是“当下”。

而真实的世界,偏偏不是一张张静止的照片。前车为什么突然刹停,那个行人为什么折返,旁边那辆车是不是要加塞,这些判断靠的不是“看见”,是“记得”和“预判”。一个看不懂时间的司机,反应再快,也只是个高级点的应激反射。

这恰好戳中了黄仁勋一直在讲的那件事。他把AI的进化排成四步:感知、生成、代理,最后是物理AI,那种能走出屏幕、在真实世界里动手干活的AI。今年1月的CES上,他放话说物理AI的“ChatGPT时刻”已经到了。数字AI学的是互联网上的文本和图片,物理AI得在一条条真实的马路上学因果,而因果的载体,就是时间。

记住30秒,预判6秒

小鹏这次拿出来的东西,拆开看是三件。

第一件叫Infini-VLA长时序架构,负责“记住”。它让模型能留住前30秒的道路信息,把连续发生的事串成一条线,而不是一帧一帧孤立地看。30秒什么概念?城区道路五六十公里的时速,30秒够一辆车从正常行驶到稳稳停住,也够一个行人横穿好几条马路。过去模型只盯着“此刻”,现在它脑子里装着刚刚发生的30秒,判断的底气自然不一样了。

第二件叫流式自回归推理,负责“边看边想”。老路子的逻辑是“看、算、输出、再看”,串行着走,像一格格推。新法子把这几件事并起来做,端到端的响应速度快了300%。碰上前车急刹、行人折返、旁车加塞,车子的反应会像个开了半辈子出租的老司机——谈不上神,但稳,且不慌。

打开网易新闻 查看精彩图片

第三件叫X-Foresight预测世界模型,负责“预判”。它根据目标物的位置、速度、运动趋势和路况,推演未来6秒周边交通参与者的可能动作。6秒,正好是那辆突然变道的车从并线到驶入你前方的时间,也是一次急刹从发生到停稳的时间。把"接下来6秒"算进决策里,这就不是应激,是提前量。

顺带一提,这三件事背后还藏着一个叫MoT的混合架构,干的是调度:城区、园区、泊车,不同场景交给不同的“专家”去处理,免得互相干扰。说白了,就是把模型的能力分门别类,该谁上谁上。

合起来的效果,官方给了一个数:综合安全能力提升20倍。这个数具体怎么算的,口径是什么,我一时拆不干净,但方向是对的——安全这件事,从来不是靠某一个指标堆出来的,是“记得住、想得快、猜得准”三样凑齐了,才谈得上。

更大的模型,是为了走得更远

“为什么我们需要一个更大的模型?”小鹏通用智能中心负责人刘先明在现场问了这么一句,又自己答了:参数量够大,泛化能力才够强,而泛化,是快速进入全球市场的前提。

于是端侧模型的参数量扩大了3.5倍,是主流VLA的15倍以上。这里有个很多人会忽略的点:智驾模型是跑在车上的,端侧算力就那么多,参数越大,越考验压缩和部署的功夫。这也是为什么他们同时拿出一个叫图灵VLA 2.0 Lite的蒸馏版,把大模型的能力"挤"进算力更低的平台,让老车主也能沾光。9月首批推送,G9L的Max版先上。

还有那个叫Master Agent的东西,更值得盯一眼。它建在自研的Omni全模态模型上,把负责开车的VLA和负责聊天的座舱大模型VLM,第一次缝成一个整车大脑。以前的车是“听懂一句话”,现在是“理解你想干什么”——你说一句“靠边停”,它自己找位置、自己变道、自己停稳,从语音指令一路走到自主执行。小鹏还把Robotaxi上的部分L4能力,下放到了量产车。

打开网易新闻 查看精彩图片

全球化这件事,这次也交了底。第二代VLA已经在德国做完了本地化验收测试,用中国数据训练的模型,几乎不加本地数据,在德国城市道路上的体验和国内高度接近。目标是明年上半年先在欧洲拿到监管许可,再陆续交付。这背后其实是个挺硬的事实:一套能跨语言、跨路权、跨驾驶习惯还不太掉链子的模型,靠的是通用能力,不是堆本地规则。而这,又绕回了那句“为什么需要更大的模型”。

一套底座,两副身体

8月24日,就在这场体验日前三天,小鹏的机器人业务完成首轮融资:超9亿美元,投后估值超63亿美元,刷新中国具身智能单轮私募融资的纪录。IDG资本领投,高榕参投,腾讯和阿里两家战略投资方也进来了。

这事跟智驾有什么关系?关系大了。因为驱动那辆车的模型底座,和驱动那个人形机器人IRON的,是同一套。IRON身上那三颗图灵AI芯片,算力2250 TOPS,跑的就是小鹏那套物理世界基座模型,端侧部署,不用远程遥控就能自己干活。全身76个自由度,单手21个,这些数字放在人形机器人圈子里,是排得上号的。而且这具机器人做得相当拟人,首创的全包覆柔性晶格,把关节和线束都藏进柔软的“皮肤”里,好看,也安全。

说白了,小鹏现在讲的故事,从“一家会做智驾的车企”,悄悄换成了一套物理AI底座:先在一辆车上跑通,再复制到一具人形机器人上,往后还有飞行汽车。这也是他们今年4月1号把“小鹏汽车”正式改叫“小鹏集团”的底气:名字里少了个“汽车”,格局里多了整个物理世界。

广州那边也没闲着。天河那个约11万平方米的机器人量产基地,今年2月就动了工。按计划,IRON今年年底量产,先在自家门店和园区里试用,2027年再对外交付。从一辆车到一具机器人,从一门手艺到一个平台,这一步迈得不小,但逻辑是通的:物理世界里的难题,本质上是同一类难题。

护城河不在模型里

写到这里,我得说句泼冷水的话。

如果小鹏只是发布了一个更大的模型,这新闻撑不了几天。模型这种东西,今天你3.5倍,明天他5倍,卷参数是没有尽头的。真正难抄的,是支撑这个模型一遍遍变强的那个东西——他们叫它AI Infra。

打开网易新闻 查看精彩图片

数据、训练、仿真、评估、部署、算力,这条链子小鹏搭了好几年。钱也是实打实砸进去的,2026年一季度研发投入29.1亿元,同比涨了46.8%,上半年累计58.2亿元,相当一部分压在图灵芯片、VLA大模型这些物理AI项目上。百万级的车队在路上跑,攒下的是十亿级的数据资产;单次训练的数据吞吐量到了1亿clips,比半年前涨了10倍。数据越多,暴露的问题越充分,模型迭代越快,又能生产更多数据——这是个正向循环,转起来了才有复利。

何小鹏在财报电话会上说过一句我印象很深的话:Scaling Law在物理AI、在自动驾驶和机器人身上,一样成立。翻译过来,就是“大力出奇迹”这件事,在马路和车间里同样有效,只要你能源源不断把真实世界的反馈喂回模型。

这也注定了,物理AI这事急不得。数字AI可以靠抓取互联网上的海量文本一夜起来,物理AI得一辆车一辆车地跑,一个场景一个场景地磨。护城河不在某一版模型有多惊艳,而在你能不能让模型持续进化。产品会换代,模型会过时,能留下来的,是持续迭代的那套能力。

我一直觉得,“时间”是这个行业里最被低估的一个词。车厂们吵了这么多年的算力、参数、芯片,争的其实是同一件事——谁能让机器更早地明白,世界是连续流淌的,不是一张张静止的截图。让AI记住过去的30秒,预判接下来的6秒,表面看是参数的跃迁,往深了说,是机器第一次学着用“因果”而不是“像素”去看路。

而对一家公司来说,时间同样是最诚实的裁判。那些靠一版爆款模型、一场融资故事起高楼的公司,时间会替我们记住它们的下场;而真正愿意把十年的数据、十亿级的场景、一代代工程师的耐心压进去的企业,时间也终会给它一个交代。

AI学会看时间,用了这么多年。而时间会记住,谁是真的在做事。

打开网易新闻 查看精彩图片