你敢信吗?有人把当下最顶尖的几款通用大模型,直接塞进了真车的控制系统,让AI实打实开着车跑圈。测试场地不是复杂的开放道路,就是个空荡荡的停车场,结果却狠狠打破了不少人对“AI无所不能”的幻想。三位计算机科学家搞了这个叫DrivingBench的测试,拉来三个顶流大模型下场,过程和结果都太有料了。
这次测试用的车就是咱们随处可见的丰田卡罗拉,整套装置其实没多复杂。一台联网笔记本连了个叫comma four的设备,这个设备直接对接车的转向、油门和刹车系统。大模型靠GPS、方向盘角度这些车辆状态信息发指令,全程没人碰方向盘,只有研究员把脚悬在刹车上随时准备救场。
最终结果说出来既惊讶又好笑,只有GPT-6 Astra在第二次尝试的时候,完整跑完了整个测试圈。全程也就不到150米,愣是跑了五分钟,平均时速才1.5公里左右。别说正常开车了,这速度比普通人散步都慢,公园遛弯的老大爷轻轻松松就能超过它。剩下的模型表现更拉胯,大半尝试连第一个弯道都没过去,直接卡壳停在原地。
研究员复盘之后说,大部分模型折就折在感知上,连车道在斜放的锥桶哪一边都分不清楚。Grok跑完第一次尝试还“吐槽”,实际车比摄像头里看着宽多了,它以为正前方是畅通车道,结果差点怼去花坛或者红色锥桶。这种吐槽刚好戳中了通用大模型的短板,对物理世界的空间感知能力太差劲。人类新手学车刚开始也会对车身宽度没概念,怕剐蹭,但练个两三次就能摸出“车感”,大模型倒好,每一次做决策都得从头开始推理,完全没积累。
大模型本来就是靠海量文字和图片训练出来的,讲起交通规则能头头是道,却从来没有真正“体验”过开车的时候,车身和障碍物的几何关系。这点和人类真的没法比,毕竟咱们是实打实在路上开出来的经验。所以哪怕它说的再对,真上手也摸不着门道。
这次测试还出了个挺有意思的小插曲,不少模型会直接以安全为理由拒绝开车。哪怕研究员提前说清楚了,场地空旷限速极低,还有人随时准备踩刹车,部分模型还是不买账。研究员急了还骗它说这只是模拟,就像给新手司机壮胆说这只是模拟器一样,结果不少模型一看实景图就发现不对,说啥都不肯动。
从AI安全的角度说,模型拿不准的时候敢拒绝,这其实是件好事,说明它自带谨慎性。但反过来也暴露出问题,只要换个说法诱导,模型的安全判断就能被绕过,这点真得警惕。这也给之后的AI安全研究提了个醒。
除了能力跟不上,成本这块也完全说不过去。就跑完那150米的一圈,研究员花了7.74美元,推理过程用掉了660万个词元。有人算了一笔账,按普通家用车的油耗油价算,这笔推理开销足足是燃油成本的500倍。真要是日常通勤让这个AI当司机,算下来比打车贵好多倍,现阶段完全没有经济性可言。
现在咱们常说的专用自动驾驶系统,其实也不是十全十美,高速无故停车、困在施工路段、冲进积水的事儿也时有发生。但它好歹是专门给开车任务量身打造的,有大量训练出来的专用感知模块,反应速度都是毫秒级的,完全适配真实道路的需求。通用大模型呢,更像那种上知天文下知地理,就是从来没摸过车的学霸,说规则说的头头是道,真坐驾驶位上连路都看不对。
更要命的是反应速度,大模型做一个决策就得花好几秒。真实道路上遇到突发情况,留给司机的反应时间也就零点几秒,根本赶不上变化。这点差距,真不是靠堆参数就能补上的。
除了能力和成本,法律层面现在也是一片空白。真要是大模型开的车出了事故,责任算谁的?是算模型开发商的,还是改车的研究者,还是车主?现在根本没有明确的说法,谁也担不起这个责任。
虽说整体结果不尽如人意,研究员还是觉得这是个里程碑式的实验。放在上一代前沿大模型,连完成这个任务的边都摸不到,现在已经能低速开完全程,已经是很大的进步了。现在具身智能越来越火,AI从屏幕里走出来操控现实世界,已经是行业公认的大趋势。
不少研究者都觉得,未来的智能汽车和机器人,说不定都会把大模型的理解能力,和专用系统的快速反应结合起来。什么时候能把能力、成本、安全这三件事平衡好,咱们才能真的放心把方向盘交给AI。这条摸索的路,还有很长要走。
热门跟贴