No.0364
Science Partner
Bring you to the side of
导 读
如果AI大语言模型写错一句话,人可以让它重新生成。
但如果AI控制一辆高速行驶的汽车时判断错了,情况可能就完全不同了。
2026年夏天,人工智能正在跨过这条边界。
7月27日,美国斯坦福大学以人为本人工智能研究院(HAI)发布一份有关“世界模型”的政策报告,认为人工智能正在从以语言为中心的阶段进一步走向“空间智能”:模型不仅生成文字、图像,还要建立对现实环境的动态表征,预测环境如何随行动发生变化。报告特别指出,世界模型可能成为具身人工智能训练的重要基础。
同一时间点,小鹏VLA 2.0开始进入德国道路测试。德国专业媒体注意到,小鹏汽车和人形机器人已经开始共享图灵芯片和部分AI基础。更早一些,大众汽车与小鹏联合开发的首款车型进入量产,大众首次在量产车型中采用小鹏提供的智能驾驶系统和图灵AI芯片。
这些事情放在一起看,VLA 2.0值得关注的地方,就不只是“智能驾驶又升级了”。
它指向一个更值得我们每一个热爱科学的小伙伴关心的变化:过去几年,大模型主要学习怎样生成内容。而下一阶段,一部分模型开始学习怎样理解现实、预测下一秒,并直接采取行动。
汽车,很可能成为这种人工智能最早大规模进入普通人生活的载体。
走,跟伙伴君来!
今日主笔|旻宏
汽车开始有了“大模型”:小鹏VLA 2.0真正想改变的,可能不只是自动驾驶
01. 从预测“下一个词”,到预测“下一秒”
大语言模型处理的是一个相对熟悉的问题:根据上下文,预测接下来最可能出现什么。
进入具体智能,特别是新能源汽车以后,预测的对象彻底改变了。
车辆来到十字路口,需要判断的不是下一个词,而是前车会不会减速、旁边自行车是否准备横穿、被大车遮挡的位置是否可能出现行人,以及自己如果继续前进,两三秒后整个交通场景会变成什么样。
VLA原本是Vision-Language-Action,即“视觉—语言—动作”。美国电动车科技媒体Electrek今年6月在美国计算机视觉与模式识别会议(CVPR)期间采访小鹏通用智能中心负责人刘先明时披露,第一代VLA会把视觉信息先转换成类似语言的中间表征,再生成驾驶动作。到了VLA 2.0,这一实时驾驶过程中的“语言中间层”被去掉,视觉信息更直接地通向车辆行动。语言仍可作为驾驶员的指令输入,但不再要求模型每做一个动作,都先把看到的世界“说一遍”。
这个变化看似只是模型架构调整,背后却是一个颇有意思的问题:人类很多行动,本来就发生在语言之前。
人看到前车突然急刹,并不会先在脑中完整生成一句“前方车辆正在快速减速,因此我应该制动”,才开始踩刹车。现实世界要求的首先是及时感知、判断和行动。
更关键的是“预测未来”。
据Electrek报道,小鹏正在训练系统同时预测两件事:车辆下一步应该怎样行动,以及未来时刻摄像头可能看到怎样的场景。企业将世界模型与VLA视为同一个问题的两个侧面,一个学习怎样行动,一个学习现实世界怎样变化。
一个经验丰富的司机看到路边停着一辆遮挡视线的大货车,往往会下意识减速,并不一定因为他已经看到了行人,而是因为经验告诉他:那里可能发生什么。
机器如果也要具备类似能力,就不能只停留在对当前环境的识别,还要对接下来几秒可能出现的变化作出判断。从这个角度看,VLA 2.0所强调的“预测未来场景”,反映的正是智能驾驶从感知当前状态,进一步走向对动态环境进行推演的一种技术尝试。
02. 汽车为什么可能成为具身智能的第一块“数据矿”
人工智能需要的数据正在改变。
大语言模型时代,互联网上存在海量文字、图片和视频,可以成为训练材料。Physical AI进入现实世界以后,光“看过世界”已经不够。模型还需要知道:人在这个场景里采取了什么行动?汽车打了方向以后,周围环境怎样变化?机器人伸手抓杯子,是成功了,还是滑落了?
斯坦福HAI在7月发布的世界模型报告特别指出,世界模型目前稀缺的一类资源,是带有行动信息的真实交互数据,包括机器人运行轨迹和车队日志。这类数据不像网页文本那样能够大量直接获取,可能成为未来Physical AI竞争中新的稀缺资源。
这使汽车处在一个非常特殊的位置,它本身就是一种已经高度规模化的机器人。摄像头、雷达等传感器负责“看”;车载计算平台负责“想”;转向、制动和动力系统负责“做”。更重要的是,大量汽车每天都在复杂真实环境中运行。
一次变道、一次避让、一次紧急刹车,其实都形成了一个完整的链条:看见了什么——作出什么判断——采取什么动作——现实世界产生什么结果。
过去互联网公司掌握搜索、点击和文本数据,是训练数字世界AI的重要资源。到了Physical AI阶段,真实世界中的车队日志、机器人的运动轨迹以及行动产生的反馈,可能成为另一种难以复制的训练资源。于是近来一个现象愈加明显:车企谈论的不再只有汽车,还开始频繁出现世界模型、机器人和Physical AI。
车厂,拥有的不再只是制造汽车的工厂。
AI进入现实世界十分需要的一样东西:规模化的“身体”和长期产生的行动数据。从这个角度看,汽车不仅是具身智能的一种应用,也可能成为训练具身智能的一所大型“学校”。
03. VLA 2.0从“一辆车”变成“一套能力”
判断一种汽车技术有没有更大的产业意义,有一个简单的观察角度:它能不能离开自己的品牌和车型。
今年3月,路透社报道,大众与小鹏联合开发的ID. UNYX 08开始量产。大众方面表示,该车型采用小鹏提供的自动驾驶系统和图灵AI芯片,双方第二款联合车型也计划于今年推出。
这个信号比一次“全程零接管”的试驾更大。一家车企研发的智能驾驶能力,开始进入另一家全球大型汽车制造商的产品体系。传统汽车工业当然早有博世、大陆集团这样的供应商。但模型时代可能出现一种新的供应关系:过去交付的是摄像头、雷达、刹车系统、控制器;未来交付的可能是一套能够持续训练、升级,并适配更多车型的“智能”。
德国电动交通专业媒体Electrive今年7月在小鹏慕尼黑活动的报道中注意到,小鹏展示的人形机器人IRON 2.0使用与其电动车相同的图灵芯片和部分AI技术基础。这还不能说明汽车和机器人已经使用同一个完整模型。汽车在道路上运动,人形机器人需要抓取、行走、操作物体,两者的身体结构、传感器和任务难度差异巨大。由“会开车”直接推导出“会做家务”,显然还太远。但方向已经值得观察:原本被划分为汽车、机器人等不同产业的机器,开始尝试共享计算平台和部分对物理世界的智能能力?
这很像大模型曾经在数字世界发生过的变化:过去不同的软件分别完成翻译、摘要、问答和写作,后来一个基础模型开始覆盖越来越多任务。
Physical AI会不会也出现类似过程?
未来衡量一家企业的技术能力,也许不再只问“这辆车的智驾好不好”,而要问:同一种感知、预测和行动能力,能不能迁移到不同汽车、机器人乃至其他具身智能机器上?
如果这件事成立,那么VLA 2.0真正要证明的就不只是“一辆车可以自己开得更好”。它想触碰的是更大的问题:汽车上训练出来的物理世界智能,能不能逐渐成为一种可迁移的基础能力。
04. 慕尼黑的接管,真正的难题
模型越通用,真正遇到的问题反而越具体。
今年夏天,VLA 2.0测试车来到德国慕尼黑。
美国科技媒体CleanTechnica记录了一段很有代表性的道路测试。车辆已经能够处理当地道路上的汽车、行人和自行车。报道还表示,与在中国道路上的表现相比,系统在德国明显更加谨慎,尤其面对行人和自行车时,会留出更大的安全余量。
随后,一辆执行紧急任务的救护车从后方驶来。测试车当时位于一条空间较窄的单车道,道路两侧都有明显路缘。按照正常驾驶逻辑,车辆不能随意驶上路缘区域,但在人类驾驶员眼里,此时还有另一条更高优先级的规则:尽快为救护车腾出通道。在确认周围安全的情况下,人类可能会临时做出平时不会做的动作。
VLA 2.0没有自行完成这个特殊操作。
它没有贸然越过路缘,也没有主动实施一个系统尚不能确认安全性的非常规动作。最终,驾驶员接管车辆,在确认环境允许后临时驶上路缘,为救护车让出了空间。
如果只看“发生了接管”,很容易把它理解为系统能力不足。但这个场景刚好在于,它并不是一道简单的“有没有认出救护车”的题。系统面对的是多个要求同时存在:通常不能压上路缘;现在又必须为紧急车辆让路;与此同时,还要判断路缘之外是否有人、空间是否足够,以及这种非常规行为是否符合当地环境。对一个有经验的人类司机来说,这些判断往往几秒钟就能完成。对机器而言,却涉及规则优先级、环境预测、地方驾驶习惯以及异常情境理解。
从结果看,没有擅自突破通常驾驶边界,可以理解为一种偏保守的处理方式。之后需要继续提高的,是系统将来能否进一步理解:什么时候应该严格遵守通常规则,什么时候在更高优先级目标出现时,可以确认风险后合理突破通常规则。
这不是VLA 2.0独有的问题。
今年7月8日,美国国家公路交通安全管理局(NHTSA)在记录到多起无人驾驶车辆干扰执法、消防及其他第一响应人员开展工作的事件后发出警示。该机构指出,无法正确识别和响应紧急现场、应急车辆及相关安全信号的自动驾驶车辆,本身可能给公众带来安全风险。
换句话说,慕尼黑遇到的是整个自动驾驶行业迟早都要回答的一道题:机器不仅要懂交通规则,还要懂什么时候几条规则发生了冲突。
这次测试的另一个值得肯定之处在于,车辆已经从中国道路被带到一个交通文化、道路环境明显不同的欧洲城市。它没有因为环境改变而完全失去能力,而是在大多数常规场景中继续工作,只在一个极少见、规则相互冲突的情形下需要人类介入。至少显示出一定的跨地域适应能力,也为进一步验证其泛化能力提供了现实场景。
05. 对普通人而言,变化可能早于“方向盘消失”
很多人理解自动驾驶,习惯等待一个标志性时刻:汽车什么时候彻底不用人开?
而你有没有想过,真正影响日常生活的变化,很可能在那一天到来以前已经发生。当汽车越来越依赖持续训练和更新的模型,一辆车的能力就不再完全固定在驶下生产线的那一刻。过去买车,人们比较动力、底盘、空间、续航和配置;今后,模型版本、OTA更新、真实道路数据、安全冗余以及第三方评估,可能成为消费者判断一辆车的重要指标。
一辆传统机械汽车用了三年,性能大体沿着逐渐损耗的方向变化。一辆越来越依赖模型的智能汽车用了三年,却可能因为软件升级,泊车能力、变道逻辑甚至处理复杂路口的方式都和刚买回来时不同。这意味着,人购买的不再只是一件机械产品,还包括一套会持续改变行为的行动型AI系统。
这,也给消费者带来一个新的问题:一次OTA之后,这辆车到底学会了什么,又有什么能力边界没有改变?
人与机器的责任边界因此变得更重要。
美国国家公路交通安全管理局目前对Level 2驾驶辅助的界定仍十分明确:系统虽然可以同时控制车辆转向和加减速,但驾驶员仍必须保持注意,并继续承担驾驶责任。机器开得越来越像人,反而容易让人忘记这一点。
过去我们谈AI素养,通常是提醒人们不要完全相信大模型生成的一段文字。具身智能进入现实生活以后,更需要明白的是,知道机器在什么地方值得信任,也知道什么时候不能把决定权交给它。而这可能才是VLA 2.0以及这一轮Physical AI竞争,最终与每个普通人的关系。它的重要性并不取决于今年谁在某一次测试里多开几个路口、少接管几次。真正发生变化的是:过去,大模型给我们一个答案,最终行动仍由人完成;现在,模型开始连接方向盘、刹车以及机器人的手脚。
如今,人工智能犯错的含义也变了。它不再只可能生成一个错误结果,还可能直接影响现实世界。于是,人工智能正在从“生成结果”,走向“产生后果”。
汽车,很可能就是普通人第一次大规模面对这条边界的地方。
我是旻宏,咱们下期见~
本文仅作科普分享使用,欢迎小伙伴们点、收藏、关注,以备不时之需,当然更欢迎您把 介绍给周边可能需要的更多伙伴们呀。
热门跟贴