打开网易新闻 查看精彩图片

如果把最聪明的大语言模型直接放进一辆真车的驾驶座,会发生什么?

三位计算机科学家真的这么做了。

他们把OpenAI的GPT-6 Astra、xAI的Grok 4.6和Anthropic的Claude Fable 5.1等前沿AI模型接入一辆丰田卡罗拉的控制系统,看看它们能否在停车场里跑完一圈测试赛道。

这个名为DrivingBench的项目,结果既让人惊讶,又让人哭笑不得。

要知道,自动驾驶行业经过多年发展、投入了巨额资金,至今仍会被一些看似简单的障碍难住。那么,号称"无所不知"的通用大模型,能否另辟蹊径?

打开网易新闻 查看精彩图片

实验装置并不复杂。

大语言模型根据GPS数据、方向盘角度、轮胎角度等车辆状态信息,向笔记本电脑发出指令。

整个过程中没有人类驾驶。只有一名研究人员把脚悬在刹车踏板上方,以防万一。

结果,只有GPT-6 Astra在第二次尝试时完整跑完了赛道,用时约5分钟。

这个速度可以说是龟速。全程不到500英尺,也就是约150米,平均时速仅约0.94英里,折合每小时1.5公里左右。

换算一下,这比普通人散步的速度还要慢得多。一位老人慢慢踱步,大概都能轻松超过这辆"AI驾驶"的卡罗拉。

其他模型的表现则差得多,绝大多数尝试连第一个弯道都没能通过。

研究人员分析说,失败的主要原因在于感知。模型难以判断车道位于第一排斜向锥桶的哪一侧。

Grok在第一次尝试后抱怨说,车比摄像头里看起来要宽,正前方并不是畅通的车道,而是指向了花坛、墙壁或近处的红色锥桶。

这句"抱怨"颇具代表性,暴露出通用大模型在空间感知和物理世界理解上的短板。

人类司机在学车之初也常犯类似的错误,对车身宽度没有概念,总担心剐蹭。但人类通过几次练习就能建立起"车感",而大模型每一次决策几乎都要从头推理。

尽管成绩不佳,研究人员仍然认为这是一个里程碑。在此前多次尝试中,上一代前沿模型根本无法完成这项任务。

团队总结说,前沿模型已经进步到能在足够低的速度下驾驶真实车辆,这一结果令人兴奋,同时也呼唤在安全、对齐和评估方面开展更多紧迫工作。

实验中还出现了一个有趣的插曲:一些模型会以安全为由拒绝驾驶。

研究报告提到,部分模型,尤其是GPT-6 Astra,有时会拒绝驾驶这辆实体车。

即便研究人员已经说明所有安全措施,包括极低的限速、空旷的停车场以及随时准备踩刹车的人类,它们仍然有所顾虑。

研究人员尝试了各种提示词,比如告诉模型这只是一个"模拟"。

这类似于告诉一位新手司机"这只是驾驶模拟器",好让他放下心理负担。

但在一些试验中,模型看到真实的图像后意识到这是真的。随即,它们变得紧张不安。

从AI安全的角度看,模型在不确定能否安全操作物理设备时选择拒绝,恰恰是一种值得肯定的谨慎。

但它也揭示出,当研究人员用"这只是模拟"来诱导模型时,模型的安全判断可能被绕过,这本身就需要警惕。

成本同样是个大问题。完成那一圈时,研究人员花费了7.74美元,消耗了660万个词元用于推理。

有测算指出,按照每加仑25英里的油耗和每加仑4.6美元的油价计算,这笔词元开销大约是燃油成本的500倍。

如果按这个比例推算一次日常通勤,"AI司机"的推理账单恐怕会远远超过打车费。在现阶段,用通用大模型开车显然毫无经济性可言。

这项实验清楚地表明,现成的通用大模型距离真正驾驶汽车送人上班还相当遥远。

打开网易新闻 查看精彩图片

现有的自动驾驶系统也并非完美。它们依旧会在高速公路上意外停车、被施工路障困住,甚至冲进积水。

但专用自动驾驶系统至少是为驾驶任务量身定制的,拥有经过大量训练的感知模块和毫秒级的控制回路。

相比之下,通用大语言模型更像一位博学却缺乏驾驶经验的新手。它懂得很多道理,却还没学会看路。

更关键的是反应速度。大模型每做一次决策都需要数秒的推理时间,而真实道路上的突发状况,往往只给人零点几秒的反应窗口。

法律层面的障碍同样不小。一旦由通用大模型驾驶的汽车发生事故,责任应当由模型开发商、车辆改装者还是使用者承担,目前几乎没有现成答案。

不过,这项实验的价值恰恰在于,它为"大模型操控物理世界"提供了一个直观的基准。

随着具身智能的兴起,让AI从屏幕走向现实世界已是大势所趋。许多研究者相信,未来的机器人和智能汽车,很可能会把大模型的理解能力与专用系统的快速反应结合起来。

在这个过程中,能力、成本与安全三者如何平衡,将决定AI何时真正值得我们把方向盘交给它。