真实世界不是一帧帧孤立画面的简单叠加,而是连续变化、因果交织的演进过程。传统模型能识别车辆、行人、信号灯,但面对突发刹车、行人折返、旁车强行加塞等复杂场景,仅靠“看见”远远不够。小鹏第二代VLA全新引入Infini-VLA长时序架构,让AI记住前30秒的世界,将连续发生的道路事件串联成完整的时序记忆,决策不再依赖碎片化快照。同时,模型采用Streaming Inference流式自回归推理,从离散推理走向连续推理,端到端响应速度提升300%,真正做到“边看、边想、边行动”。更关键的是,X-Foresight预测世界模型首次上车,可预判6秒内周边交通参与者的可能行为,让车辆提前规划最优路径。记忆过去、感知现在、预判未来,三个维度共同构筑起完整的时空理解能力。
本次升级不止于智能驾驶。小鹏首次推出Master Agent整车大脑,将VLA与VLM(视觉语言模型)深度融合,让车辆从“听懂一句话”走向“理解用户真正想完成什么”。Master Agent基于自研Omni全模态模型,能解析自然语言和模糊语义,自动拆解意图并调度智驾、底盘、座舱、车身控制等垂直Agent协同执行,实现从理解到行动的闭环。新版本还带来“语音靠边停车”“语音控制就近泊入”功能,用户口头下达停车指令,车辆即可在智驾状态下自主寻找位置并完成泊入——这正是小鹏将Robotaxi的L4级能力逐步下放至量产车的缩影。
在性能提升的同时,小鹏坚持科技普惠。通过学习式Token压缩与蒸馏训练,第二代VLA基座模型能力得以部署到算力更低的平台,蒸馏版图灵VLA 2.0 Lite预计9月开启推送,G9L Max版本将首发搭载,让更多用户享受到高阶城区辅助驾驶。
从AI汽车到通用人形机器人,再到飞行汽车等更多智能本体,小鹏的物理世界基座模型正不断拓展与真实世界交互的边界。模型会迭代,产品会变化,但持续迭代模型的能力和支撑产品进化的基础设施,才是产生长期价值的根基。随着时间维度被真正纳入AI的理解框架,物理智能的下一章正在被改写。
热门跟贴