想象一个再普通不过的晚高峰路口:行人低头刷着手机,脚却已经挪向斑马线边缘;旁边车道的车缓缓贴上你的车身,车身姿态微微倾斜 —— 是要强行加塞,还是虚晃一枪?这类问题,老司机扫一眼就有答案,靠的是多年驾驶攒下的 "时间感":看得懂趋势,等得起变化,知道对方 "下一步大概要干什么"。
而过去的智能辅助驾驶,更像一个只看当下的 "复读机"。它认识车、认识人、认识红绿灯和车道线,却读不懂 "此刻正在发生什么"—— 因为真实的马路从来不是一张张静止的照片,而是一条连续流动、随时可能生变的河流。危险恰恰藏在变化里:前车轻轻一偏可能就是要并线,行人脚步一顿可能就是改主意。只盯着 "当下这一帧" 的 AI,天然慢半拍。
8 月 27 日,小鹏在广州把这场关于 "时间" 的课补上了。在以 "TIME 时间" 为主题的物理 AI 分享暨第二代 VLA 全新版本体验日活动上,小鹏正式发布第二代 VLA 大模型自上线以来最重要的一次升级,全新 XOS 6.3.0 将由小鹏 G9L 全球首发。用官方的话说,这次升级让 AI 理解世界的维度,从 "3D 空间" 跃迁到了 "4D 时空"—— 它第一次真正理解了 "时间"。
让车 "看懂时间":30 秒记忆、6 秒预判,和一个快三倍的 "大脑"
所谓 "4D 时空",拆开看并不玄乎:过去车端模型只理解静态三维空间,把眼前路况当一张张快照来识别;现在 "时间" 成了模型里的一个新维度,AI 不仅知道 "现在哪里有什么",还知道 "刚才发生了什么、接下来大概会怎样"。小鹏把这一套能力分成三个清晰的落点,正好对应人类司机的三个本能。
第一,记住过去。新引入的 Infini-VLA 长时序架构,让模型能调用此前 30 秒的道路信息。这就像新手司机只盯着车头前几米,而老司机脑子里装着半分钟的车流变化。连续发生的事件不再被割裂成孤立的画面 —— 前车从哪个位置开始偏移、行人的动向是如何一步步变化的、这条车流过去半分钟是什么节奏 —— 全部被串联起来,形成完整上下文,驾驶判断终于不再 "断片"。判断有更长的上下文,意味着模型能提前识别 "趋势",而不是等事故快发生了才被动反应。
第二,反应更快。道路情况不会等 AI 算完再变化,所以这一版同步升级了推理效率,采用流式自回归推理(Streaming Inference),端到端响应速度提升 300%。过去传统模型是 "看一帧→算一帧→输出一个动作→再看下一帧" 的串行流程,遇到突发总有一段肉眼可感的 "反应延迟";现在改成了 "边看、边想、边行动" 的并行处理。体现在驾乘体验上,就是遇到前车急刹、行人折返、旁车强行加塞这类状况时,车辆的动作更像老司机提前松油门、备好刹车的预判性操作,而不是紧急情况下的猛烈制动 —— 舒适性和安全性是两回事。
第三,预判未来。X-Foresight 预测世界模型首次上车,能够推演未来 6 秒内周边交通参与者的可能行为。它不再只对眼前画面做应激反应,而是综合目标物的位置、速度、运动趋势和道路环境,把几种可能的 "剧本" 都预先算一遍,再选择最稳妥的行动。官方举的例子很直观:在多出口环岛,模型会根据实际情况追踪目标出口;在夜间十字路口,它能预判信号灯即将发生的切换。预测更多种未来,才能选出更好的行动 —— 这正是人类司机 "眼观六路" 的 AI 版本。
此外,新版还引入 MoT 混合架构,把城区道路、园区、泊车等不同场景的任务,拆给不同的 "专家" 模型分工处理,减少任务之间的相互干扰,让模型在不同驾驶任务间切换得更稳定,避免 "顾此失彼"。
技术之外,小鹏还正面回应了一个问题:"为什么我们需要一个更大的模型?" 答案指向泛化能力 —— 更大的参数量意味着模型见过更多、学得更透,也才能支撑其快速进入全球市场的野心。这一版端侧模型参数量扩大了 3.5 倍,据称是主流 VLA 模型的 15 倍以上,配合超长时序记忆、超前轨迹预判和更快的决策响应,官方给出的多维综合安全能力提升达 20 倍。参数做大之后仍能端侧部署,兼顾了时延、离线可用和数据安全 —— 这正是物理 AI 区别于数字 AI 的地方:数据来自真实世界,能力必须装进车里,而不是放在云端。
一套底座打通车、Robotaxi 与机器人:从 "自动驾驶公司" 到 "物理 AI 公司"
这次升级最值得玩味的地方,在于小鹏并不只想把 "开车" 这件事做好。它是用做机器人的思路来重构车机大脑的。
最直观的体现,是首次推出的 Master Agent 整车大脑。它实现 VLA 与 VLM 的驾舱融合,让车辆不再只是 "听懂一句话",而是 "理解你想完成什么"。Master Agent 建立在小鹏自研的 Omni 全模态模型之上,能理解自然语言和模糊语义,把用户的意图自动拆解成任务,再调度智驾、底盘、座舱、车身控制等各垂直 Agent 协同执行 —— 从 "理解" 到 "行动" 形成一个完整闭环。换句话说,整车第一次有了一个统一大脑,车辆智能也从响应单一指令,迈向自主理解意图、规划任务和协同执行。
落到体验上,用户可以直接用语音下达 "靠边停车"" 就近泊入 "的指令,车辆会在智能辅助驾驶状态下自主寻找合适位置、完成靠边或泊入,实现从" 说 "到" 做 " 的闭环。这也是小鹏把 Robotaxi 积累的 L4 级能力,通过同源技术下放到量产车的一个缩影 —— 高阶能力不再只属于试运营的 Robotaxi,而是逐渐渗透进普通消费者的日常用车。
这套逻辑贯穿了小鹏对整个物理 AI 版图的布局。第二代 VLA 基于统一技术底座,已实现 L2 到 L4 能力贯通;搭载第二代 VLA 的 Robotaxi 近日获得广州市智能网联汽车远程测试资质,可在相关一、二、三级测试道路开展主驾无安全员道路测试,意味着小鹏正式进入主驾无人的关键道路验证阶段。同一套底座也在向机器人延展:通用人形机器人 IRON 搭载 3 颗图灵 AI 芯片,有效算力高达 2250 TOPS,物理世界基座模型已实现端侧部署,无需远程遥操作即可自主完成复杂任务,同时保障推理低时延与数据安全。
资本市场对这一路线给出了相当直白的回应。8 月 24 日,小鹏机器人业务完成首轮股权融资,金额超 9 亿美元、投后估值超 63 亿美元,刷新国内具身智能行业单轮私募股权融资纪录;本轮由 IDG 资本领投、高榕创投参投,并获得腾讯、阿里巴巴两家战略投资者支持。这笔钱押注的,正是小鹏 "从汽车向机器人延伸" 的技术路线和产业化能力。
在让能力 "往上够" 的同时,小鹏也在让能力 "往下沉"。通过引入学习式 Token 压缩与蒸馏训练,在不大幅牺牲输入信息和模型容量的前提下,以更少的有效 Token 实现高质量视觉理解,把基座模型能力部署到算力更低的平台 —— 蒸馏出的图灵 VLA 2.0 Lite 预计 9 月开启首批推送,小鹏 G9L Max 版本将首发搭载,目标是让更多老车主和入门车型也能享受到更安全、更可靠的城区辅助驾驶。这其实是一个很聪明的策略:先进能力不被 "锁" 在最贵的新车上,而是随 OTA 持续惠及存量用户,扩大数据与口碑的基本盘。
全球化也在同步推进。近期小鹏在德国完成了第二代 VLA 的本地化验收测试,在几乎不增加本地训练数据的情况下,德国城市道路的实际体验与国内高度接近;小鹏目标于明年上半年率先在欧洲获得监管许可,并向海外用户陆续交付。对中国品牌而言,"把训练自中国路况的模型,几乎原样搬到欧洲还能开得顺",本身就是一次对泛化能力的压力测试。
长期主义与冷思考:护城河在基础设施,边界在用户手里
最后,把小鹏这场发布会的叙事逻辑看完整,会发现它真正想讲的是一个关于 "复利" 的故事。
小鹏反复强调一个观点:物理 AI 是一场长期工程,模型会不断迭代,但真正能形成长期壁垒的,是 "持续迭代模型的能力",以及支撑这套体系运转的基础设施。过去几年,小鹏持续投入建设覆盖数据、训练、仿真、评估、部署和算力的完整 AI Infra 体系,以自动驾驶作为第一个规模化应用场景,逐步建立从真实世界数据采集,到模型训练、测试、部署,再到用户反馈和持续优化的完整闭环。与数字 AI 主要依赖互联网数据不同,物理 AI 的数据来自真实世界,所以做好这件事必须解决两个核心问题:如何高效使用真实世界的数据,以及如何高效验证模型在真实世界中的行为。
小鹏给出的答案,是依托百万车队和十亿级数据资产构建数据飞轮。通过统一化存储、多模态检索和规模化挖掘,把海量真实道路数据转化为可持续训练模型的数据资产 —— 当前模型单次训练数据吞吐量已达 1 亿 clips,比半年前增长 10 倍。通过对数据进行结构化、标签化和语义化处理,小鹏能从海量数据中高效发现未知问题并快速反哺训练,形成 "数据越多→问题发现越充分→模型进化越快→产生更多数据" 的正向循环。这套逻辑一旦滚起来,护城河就不再是某一版模型,而是持续变强的能力本身 —— 它还能跨越汽车、机器人、飞行汽车等不同本体,不断拓展物理 AI 与真实世界交互的边界。
把视野拉远到整个行业,这轮升级正踩在一个关键节点上。工信部数据显示,2026 年以来国内搭载组合驾驶辅助功能的乘用车新车渗透率已达 70%,其中 NOA 车型超过 30%—— 当领航辅助逐渐普及,复杂场景下的判断、响应和稳定性,开始成为车企拉开差距的焦点。竞争的强度肉眼可见:理想已通过 OTA 推送 VLA 驾驶功能,华为也在今年 4 月发布 ADS 5,引入云端多智能体训练、在线强化学习和车端风险场。各家技术名称与评价口径不尽相同,但方向空前一致:从规则驱动和局部模型,转向数据、算力与大模型共同驱动的系统。
小鹏的底气来自投入与规模。2026 年第二季度,公司研发费用 29.1 亿元,同比增长 32.1%;同期收入 197.4 亿元,同比增长 8%,综合毛利率 20.7%。截至 7 月底,小鹏累计交付量已超 120 万辆 —— 不断扩大的车辆规模,既是现金流来源,也是支撑模型训练、问题发现和持续迭代的真实数据来源。
热闹之余,也有两点需要理性看待。其一是何小鹏去年底立下的 "赌约":如果小鹏 VLA 在 2026 年 8 月 30 日前,在国内达到特斯拉 FSD V14.2 在硅谷的整体表现,他将在硅谷筹建一家中国风味食堂;否则,自动驾驶负责人刘先明要接受 "惩罚"—— 这个赌约的兑现节点就在眼前。其二,也是更重要的:小鹏官方明确表示,"L4 能力下放" 更多是对技术来源和体验的描述,量产车型现阶段提供的功能仍属于组合驾驶辅助,驾驶员需要持续关注道路、随时准备接管。技术叙事再宏大,安全责任终究落在每一位驾驶员手里。
说到底,这次升级真正的价值,不是多了一个炫酷的技术名词,而是让智能辅助驾驶从 "看见" 走向 "看懂"—— 看懂时间的 AI,才算真正朝 "老司机" 的方向靠近。而这条路,才刚刚开始。
热门跟贴