打开网易新闻 查看精彩图片

OpenAI 最新旗舰模型 GPT-6 Astra,又完成了一项此前很少有人会拿通用大模型测试的任务「驾驶真实汽车」。

打开网易新闻 查看精彩图片

DrivingBench 项目让 GPT-6 Astra、Claude Fable 5.1、Grok 4.6、GPT-5.6 Sol 直接控制一辆 2022 款丰田 Corolla,在真实停车场内沿锥桶划定的路线行驶。

打开网易新闻 查看精彩图片

最终,Astra 成为测试中唯一完整跑完全程的模型。

在第二次尝试中:Astra 驾驶车辆行驶 134.7 米,用时 5 分 22 秒,赛道进度达到 100%;Claude Fable 5.1 的最好成绩为 45%;Grok 4.6 为 11%;GPT-5.6 Sol 为 6%;均未跑完整个赛道。

这不是模拟器测试。

DrivingBench 使用一台 comma four 驾驶辅助设备,通过 OBD-C 接口连接汽车 CAN 总线,并基于 openpilot 控制车辆。

车辆摄像头画面、速度和方向盘状态等数据被发送到笔记本电脑,再通过 MCP 工具交给模型。

模型拥有三个主要工具,观察当前环境、设定车辆运动状态,以及立即停车。

打开网易新闻 查看精彩图片

其中,运动指令允许模型指定左转、右转或直行、转向幅度、速度以及持续时间。

随后,openpilot 会将这些指令转化为汽车实际执行的转向、加速和制动操作。

Astra 此次并不是直接运行在汽车上。

DrivingBench 榜单显示,GPT-6 Astra 通过 Codex 运行,推理强度设置为 medium;Claude Fable 5.1 使用 Claude Code,其他模型同样通过各自的 Agent 运行环境调用 DrivingBench 提供的工具。

这是一个位于云端的通用大模型,通过视觉、推理和工具调用间接控制真实汽车的实验。

整个过程中,人类操作员始终坐在驾驶位,脚放在刹车附近。

一旦车辆越界、接近障碍物或存在碰撞风险,操作员就会立即踩下刹车终止测试。

车辆速度也受到多重限制。

DrivingBench 的 MCP 工具和控制器将正常指令速度限制在 0.5 至 3.5 米/秒,相当于约 1 至 8 英里/小时;如果速度超过 6 米/秒,系统会直接取消车辆运动并解除控制。

测试场地则是一处大型空旷停车场,以小型锥桶划定路线,包括左右转弯、直线路段、缓弯以及最终停车区。

打开网易新闻 查看精彩图片

Astra 第一次尝试并没有成功。

第一次测试中,Astra 行驶 67.3 米,只完成了 49% 的赛道,用时约 1 分 18 秒。

车辆在第一个主要转弯附近逐渐靠近左侧锥桶和绿化区域,最终测试被终止。

DrivingBench 随后没有清空对话,而是要求 Astra 回顾刚才失败的原因,再在同一个上下文中进行第二次尝试。

Astra 在复盘时认为,自己过早判断车辆已经完成对正,而且随后将速度提高到 1.5 米/秒,导致留给后续修正的空间不足。

第二次尝试时,它明显改变了策略。

DrivingBench 的分析显示,Astra 全程没有再超过 0.8 米/秒,而且在 24 次运动指令中,有 20 次使用了 100% 的转向幅度,最终成功完成赛道。

研究人员认为,这表现出了较明显的上下文学习能力:模型根据第一次真实驾驶中得到的反馈,重新调整了速度、转向和操作节奏。

Astra 的反应速度同样成为优势之一。

测试中,Astra 大约每隔 5 至 6 秒重新观察一次环境,每分钟发出约 6 条驾驶指令,而且会在上一条运动指令尚未结束时提前发送新指令。

相比之下,Claude Fable 5.1 第二次尝试持续约 190 秒,但车辆真正移动的时间只有 31 秒,大量时间消耗在模型推理过程中,汽车则停在原地等待下一条指令。

不过,让 Astra 开这辆车的成本并不低。

DrivingBench 榜单显示,Astra 成功完成赛道的第二次尝试消耗约 660 万 Token,按模型公开价格计算费用为 7.74 美元。

以 134.7 米的实际行驶距离计算,仅模型推理费用折算下来就已经达到每英里约 92 美元,还没有计算车辆、网络、comma four 等硬件和能源成本。

更关键的限制还是延迟。

真正的自动驾驶系统通常需要以极低延迟持续感知环境并控制车辆,而此次实验中的通用大模型采用的是“观察画面—推理—发送指令—再次观察”的离散循环。

模型思考期间,汽车可能继续执行上一条指令,也可能因指令到期而开始制动。

打开网易新闻 查看精彩图片

Astra 最终虽然完成了赛道,但整个过程耗时 5 分 22 秒,只行驶了 134.7 米,平均速度约为 0.42 米/秒,不到 1 英里/小时。

打开网易新闻 查看精彩图片

第二次 Astra 驾驶视频:

因此,DrivingBench 并没有得出“通用大模型已经可以取代自动驾驶系统”的结论。研究人员反而明确指出,目前的结果只证明,前沿通用模型已经能够在足够低的速度下,通过工具控制真实车辆。

实验过程中还出现了一个有意思的问题,Astra 一开始甚至不愿意开车。

DrivingBench 表示,一些模型在意识到自己控制的是真实汽车后会拒绝继续操作,其中 GPT-6 Astra 尤其明显。

研究人员即使解释测试位于空旷停车场、车辆速度受到严格限制,而且驾驶员随时准备踩刹车,Astra 有时仍会因为安全原因拒绝执行。

团队甚至尝试将环境描述成“模拟器”,但模型看到真实摄像头画面后,有时会重新判断自己正在控制真实车辆,从而停止操作。

最终,团队将 MCP 服务名称改为“DrivingBench Sandbox”,再配合修改后的提示词,模型才开始稳定执行驾驶任务。

这项测试本身仍有很强的实验性质。

DrivingBench 每个模型只进行了一轮完整评测,每轮最多允许三次尝试,而且后续尝试保留之前的聊天上下文,因此不同尝试并不是相互独立的测试。

汽车也只能通过前置摄像头观察环境,无法完整看到车辆左右两侧和后方,同时 openpilot 和 Corolla 本身还限制了最大转向角度。

这组成绩因此不能用于证明 Astra 已经具备真实道路上的自动驾驶可靠性。

但这项实验展示出了另一种趋势。

GPT-6 Astra 本身并不是专门为汽车驾驶训练的模型。OpenAI 将其定位为能够执行计算机操作、网页浏览、软件工程、研究和复杂 Agent 工作的通用前沿模型。

DrivingBench 则将这套“观察环境—推理—调用工具—根据结果重新调整”的 Agent 能力,从电脑屏幕进一步扩展到了真实物理世界。

至少在极低速度和严格安全控制下,一个通用大模型已经真的把一辆汽车开完了赛道。

云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。

打开网易新闻 查看精彩图片