记者 花子健
8月28日,电厂获悉,小鹏集团在物理AI分享暨第二代VLA全新版本体验日上宣布小鹏第二代VLA大模型迎来首次重大升级,全新XOS 6.3.0版本将于小鹏G9L全球首发。此次模型升级的核心,是让AI开始真正理解时间:从过去对物理世界的静态3D空间理解,进一步走向动态4D时空理解。全新XOS 6.3.0大版本,端侧模型参数量扩大了3.5倍,具备超长时序的上下文记忆能力,推动小鹏物理AI基座模型实现从空间理解到时空理解的底层能力跃迁。全新版本还引入了整车大脑Master Agent,实现VLA+VLM的驾舱融合,并将部分Robotaxi的L4级体验下放到量产车型。
小鹏认为,传统的模型可以识别车辆、行人、道路和交通信号,但要真正完成复杂的物理世界决策,车辆需要具备“时间逻辑”,知道过去、现在、未来可能发生什么。因此,此次第二代VLA升级的核心,是让模型第一次建立起对时间维度的理解。小鹏物理世界基座模型把“时间”纳入模型,AI理解世界的维度,从“3D空间”升级至“4D时空”。
第二代VLA全新引入Infini-VLA长时序架构,记得前30秒的时间,驾驶判断开始拥有更长的上下文,更多有效信息进入模型。因为连续发生的道路事件不再被割裂成一个个独立画面,模型可以将此前发生的动作、位置和场景串联起来,形成更加完整的时序理解。第二代VLA还采用Streaming Inference(流式自回归推理),从离散推理走向连续推理,模型推理效率提升,端到端响应速度提升300%,做到“边看、边想、边行动”的并行处理。在小鹏X-Foresight预测世界模型上车后,车辆可预判6秒内发生什么,推演周边交通参与者未来的可能行为。
与此同时,新版模型引入MoT混合架构,通过针对不同任务动态分配模型能力,减少城区道路、园区、泊车等不同场景之间的任务干扰,把不同的问题交给不同的“专家”。为了足够强的泛化能力以具备快速进入全球市场的能力,小鹏第二代VLA全新版本端侧模型参数量提升3.5倍,是主流VLA的15倍以上,结合超前轨迹预判、超长有效时序、更快决策响应,使得多维综合安全能力提升20倍。
在第二代VLA全新版本中,小鹏用做机器人的方式升级车机大脑,推出Master Agent,实现VLA与VLM的驾舱融合,让车辆从“听懂一句话”进一步走向“理解用户真正想完成什么”。Master Agent建立在小鹏自研Omni全模态模型之上,不仅能够理解自然语言和模糊语义,还能将用户意图自动拆解为任务,并调度智驾、底盘、座舱、车身控制等垂直Agent协同执行,实现从“理解”到“行动”的闭环。
全新版本还将支持“语音靠边停车”、“语音控制就近泊入”功能,用户只需通过语音下达停车指令,车辆即可在智驾状态下自主寻找合适位置并完成靠边停车。
小鹏第二代VLA基于统一技术底座实现了L2至L4能力贯通,搭载第二代VLA的Robotaxi已于近日获得广州市智能网联汽车远程测试资质,可在广州相关一、二、三级测试道路开展主驾无安全员道路测试。这一能力也正在向机器人等更多本体落地,小鹏通用人形机器人IRON搭载3颗图灵AI芯片,有效算力高达2250 TOPS,在此基础上,小鹏物理世界基座模型实现了端侧部署,无需远程遥操作即可自主完成复杂工作任务。
8月24日,小鹏宣布机器人业务完成首轮股权融资,融资超9亿美元、投后估值超63亿美元,本轮融资由IDG资本领投、高榕创投参投,并获得腾讯、阿里巴巴两家战略投资者支持。
通过学习式Token压缩与蒸馏训练,小鹏实现了在不牺牲输入信息和模型容量的基础上,以更少的有效Token实现高质量视觉理解,将第二代VLA基座模型能力部署到算力更低的平台,蒸馏后的图灵VLA 2.0 Lite预计9月开启首批推送,小鹏G9L Max版本将首发搭载这一蒸馏版本。
在全球化部署上,小鹏近期在德国完成了第二代VLA的本地化验收测试。这套基于中国数据训练的模型,在几乎不增加本地化训练数据的情况下,在德国城市道路的实际体验与国内高度接近。小鹏目标于明年上半年率先在欧洲获得监管许可,并陆续向海外用户交付第二代VLA。
热门跟贴