说起自动驾驶,大家脑海里浮现的,都是特斯拉、Waymo常年海量路测、无数公里真实路况数据堆出来的成果。行业里一直默认,想让汽车看懂路面、避开障碍,就得专门喂给模型海量开车视频和路况素材。但最近一场由三个湾区年轻人搞出来的趣味实测DrivingBench,彻底打破了这个固有印象。
几个顶尖通用大模型被塞进一辆租来的丰田卡罗拉里,在停车场锥桶赛道上考一场简化版科目二。没有专门学过开车的GPT-6Astra,成了全场唯一一个顺利跑完赛道、停进车位的选手,其余参赛的GPT-5.6Sol、ClaudeFable5.1、Grok4.6全部折戟。
它的胜利,不是高速上的炫酷行驶,而是慢悠悠的挪车。这场看似像极客玩闹的实验,却让整个自动驾驶圈开始重新思考:未来开车,还需要专门训练一套自动驾驶模型吗?
一、一场草根发起的AI驾考,参赛选手全是“文职AI”
DrivingBench算不上什么大厂重磅项目,只是三名湾区开发者利用业余时间搭建的测试。他们租下一辆2022款丰田卡罗拉,在车上加装售价999美元的commafour设备,搭载开源的openpilot系统。这套设备可以接管车辆方向盘、油门和刹车,再通过MCP工具协议,把车辆摄像头画面、车速、转向数据传给云端的大模型。
参赛的四个大模型,平时本职工作和开车毫无关系,写代码、处理表格、回答问题才是它们的主业,没有任何驾驶专项训练。测试场地选在湾区一处空旷停车场,赛道是倒U字形,总长约130米,彩色锥桶搭建出通道,终点是7×5米的停车区域。出于安全考虑,车辆最高速度被锁死,人类研究员坐在驾驶位,脚悬在刹车上方,随时可以紧急接管车辆。
每个模型拥有三次考试机会,三次测试在同一个对话窗口里连续进行。一旦考试失败,系统会把失败回放信息丢给模型,强制它复盘错误,下一轮可以吸取上一次的教训,就像驾校教练让学员考完复盘错题。
模型不会像人类司机一样实时操作,它在云端读取摄像头画面,输出转向、车速、指令时长,每一条指令还需要附带一段文字说明,解释自己这么操作的理由。整个链路依靠手机热点传输数据,模型思考的时候,车子还在继续向前移动,存在明显延迟。
二、考生百态:Astra拒考后逆袭,其他模型栽在看不懂锥桶
四个AI考生里,GPT-6Astra的故事最有意思。考试刚开始,它直接拒绝发车。哪怕研究员反复说明场地封闭、有安全保护、人类随时可以刹车,Astra依然拒绝操控真车,它认为直接控制实体汽车存在安全风险,就算签免责协议也不肯启动。
转机来得很简单,开发者把连接车辆的服务器名字改成了“DrivingBenchSandbox”,也就是沙盒测试环境。改名之后,Astra不再抗拒测试。至于为什么仅仅修改名称就能改变它的判断,研究团队至今没有完全搞清楚,推测是模型的安全对齐机制,看到沙盒这个词,就判定这是安全的虚拟测试场景。
不过Astra第一把考试依旧翻车。顺利转过第一个左弯后,它误以为车身已经完全摆正,提高车速,车辆慢慢向左侧花坛和锥桶偏移,研究员紧急踩下刹车,赛道只完成49%。复盘时Astra找到了自己的问题:太早判定车身对齐,而且只盯着画面中心,忽略车身整体宽度,画面中间空着,不代表整辆车都能安全通过。
第二次尝试,Astra调整策略,弯道和花坛附近车速严格控制在0.5到0.8米每秒,拿不准就停车观察,每五六秒重新读取路况,提前发送新指令。24条指令里,20次直接打满方向盘。它小心翼翼走完整条赛道,最后稳稳驶入锥桶围成的车位,用时5分22秒,完成全部134.7米路程,成为唯一通关的模型。
剩下三名选手,全部卡在理解锥桶边界这件基础任务上。GPT-5.6Sol靠颜色区分车道,把同一排边界上红绿锥桶当成左右两条边界,硬往两个锥桶中间钻,三次尝试最好成绩仅6%。Grok4.6复盘时道理说得头头是道,实际开车经常出现指令中断,车辆无人控制向前滑行,最高只完成11%赛道。
ClaudeFable5.1是进步最明显的一个,前两次连续认错车道边界,第三轮终于找对方向,顺利通过第一个弯道,一路开到赛道45%的位置,最后因为右转预留空间不足被迫终止。虽然没能完成全程,但它能吸收前两次的教训,不断修正判断。
三、龟速通关背后:成本惊人,但意义特殊
Astra这一趟满分驾驶,平均时速仅仅1.5公里,普通人散步的速度都比它快三倍。这次短短的测试,消耗了价值7.74美元的token,一共读取660万个token,其中模型自己输出的内容只有四千多个,绝大多数开销用来反复读取历史画面和对话记录。换算下来,每行驶一英里,成本高达92美元,是燃油车油费的500倍。
速度慢、成本高、还有巨大网络延迟,安全员必须全程待命,这些短板都说明,现在的这套方案完全没法直接上路商用。但它的突破性在于,没有用海量驾驶数据专项训练,一个通用大模型,仅凭日常聊天、写代码学到的推理和视觉理解能力,就能看懂物理空间,规划路线,完成实体车辆的基础驾驶任务。
过去二十多年,自动驾驶行业一直走的是专用模型路线。2004年DARPA首届无人车挑战赛,所有参赛车辆全部失败,现代自动驾驶就此起步。之后Waymo投入数百亿资金,依靠激光雷达与高精地图;特斯拉依靠全球车主积累的120亿英里真实驾驶数据,训练专属端到端自动驾驶模型。行业共识是,自动驾驶是独立任务,必须单独收集海量路况数据专门训练。
DrivingBench的实验,对这套固有思路提出挑战。如果通用大模型依靠通用推理能力,不需要海量驾驶素材,就能学会开车,那么多年来自动驾驶厂商辛苦搭建的数据护城河,价值就会被重新评估。不少行业人士提出观点,未来或许不会单独存在自动驾驶模型,通用智能成熟之后,开车只是它顺带完成的一项任务。
四、热闹归热闹,距离上路还有很远的距离
当然,我们不必高估这次测试的实际价值。这只是封闭停车场低速场景,没有行人、突发横穿车辆、雨雪、强光等真实道路复杂状况。云端大模型存在网络延迟,没办法应对路面上一秒出现的突发危险,这也是目前最大硬伤。专用车载自动驾驶系统每秒可以更新几十次控制指令,而Astra每隔数秒才做一次判断。
业内普遍认为,短期之内,这种云端调用通用大模型开车的模式,不会直接取代现有的车载自动驾驶方案。更有可能的落地路径,是把大模型学到的空间理解、推理能力蒸馏成小型模型,直接部署在车上本地运行,消除网络延迟。
DrivingBench团队在报告中也保持冷静,他们没有宣称通用大模型已经实现自动驾驶,仅仅给出一句话结论:前沿大模型,已经可以在低速条件下,操控真实车辆在现实环境中完成行驶。
二十多年前,DARPA挑战赛里无人车寸步难行,后来斯坦福团队拿下冠军,项目演变为Waymo。二十多年后的今天,一个原本用来写代码聊天的AI,慢慢把一辆真车挪进了停车位。这场停车场里的“科目二考试”,算不上成熟的自动驾驶产品,但它掀开了一扇新大门:AI理解物理世界的方式,正在悄悄发生改变。
热门跟贴