三周前,GPT-6 Astra 发布后,整个 AI 圈很快被它刷了屏。
每隔一段时间,新模型都会刷新数学、编程和推理榜单,这其实已经不算稀奇。但这次,Astra 带来的冲击更像是一次 AI 能力边界的突然扩张。它在软件工程、Computer Use、科学研究等传统强项上继续推进的同时,开始进入越来越复杂的专业工作流。
OpenAI 公布的结果中,Astra 在测试模型三维建模能力的 BenchCAD 上达到 95.9% 的几何重合率,可以根据多视角图片生成 CAD 代码;官方演示里,它还能直接操作 Blender 搭建一栋房子,再转进常用于游戏和实时三维开发的 Unreal Engine 5,变成一个可以行走的三维空间。
从平面图像反推立体空间,意味着模型必须理解物体遮挡、透视和几何关系;而操作 Blender 和 CAD,则要求它把这种空间理解进一步转化成可执行步骤,并根据结果持续修改。过去主要处理文字、代码和平面界面的大模型,开始显露出更强的空间理解能力。
这也很快引出了另一个问题。如果模型已经能够理解三维空间、读取视觉反馈,并连续决定下一步操作,那么这套能力能不能从软件里的虚拟世界进一步迁移到真实的物理世界?
于是很快,一批实验者开始把 Astra 接到机器人上。
其中一个热门测试来自机器人软硬件平台公司 RoboCurve的 YAM 双臂机器人。在这个测试中,Astra 可以读取顶部和腕部摄像头画面,以及机器人的当前状态,再决定机械臂末端移动到哪里、采用什么姿态、何时开合夹爪;底层的逆运动学和安全控制系统,则负责把这些指令转化为实际动作。换句话说,它开始承担机器人更上层的“大脑”功能。
(来源:RoboCurve)
对此,MIT 教授 Phillip Isola 随后发表了一篇文章,把这类系统称为“Robot-Use Agents”。在他的定义里,机器人开始变得有点像浏览器或电脑:模型不必掌握所有底层控制,而是通过接口调用机器人的感知和动作能力。过去限制这条路线的,主要是空间智能不足、对物理世界理解有限,以及推理速度跟不上现实变化;而 Astra 让一些现实限制开始松动。
到了最近,模型甚至从机械臂走到了汽车。
一个专门测试前沿大模型真实驾驶能力的独立项目 DrivingBench,租来一辆丰田卡罗拉,通过 openpilot 和 MCP 接口,把摄像头、车速、方向盘状态以及车辆控制能力开放给几款前沿模型。
Astra 没在有接受针对这条赛道的专门训练前提下,第一遍在弯道处偏出路线;但在同一个上下文里复盘失败后,它主动降低车速、增加观察频率,第二遍用 5 分 22 秒跑完了整条锥桶路线,也是参测模型中唯一完成全程的一个。
不过,这离真正的自动驾驶还很远。因为整个测试发生在封闭停车场,车速也相对较低,人类始终坐在驾驶座准备踩刹车,Astra 也没有直接控制汽车底层执行器。
但这些测试,都让一个过去有些遥远的问题突然变得可感起来。
过去几年,机器人行业一直在寻找自己的“GPT 时刻”,把希望押在 VLA、世界模型和机器人基础模型上。现在,一部分从业者开始思考,按照这个势头,机器人梦寐以求的“GPT”,最后会不会就是 GPT 本身?
大模型为什么开始会“控制”机器人
Astra 之所以引起具身智能行业的广泛关注,一个重要原因是,它表现出的机器人控制能力,并不是沿着传统具身智能的技术路线生长出来。
过去几年,机器人系统通常有着相对清晰的分层结构。大模型或通用视觉语言模型(VLM)位于最上层,负责理解人类指令、识别场景中的物体,并给出较高层级的任务规划;真正将这些意图转化成连续动作的,则是视觉-语言-动作模型(VLA)或其他专门训练的机器人策略模型;再往下,才是逆运动学求解、轨迹规划以及高频电机控制。
无论是英伟达 GR00T 所采用的“快慢双系统”,还是 Google Gemini Robotics 尝试直接生成动作 Token,本质上都没有完全跳出这套分工:通用模型负责理解和决策,专用控制系统负责操纵具体动作。
Astra 带来的变化在于,原本主要停留在上层的通用模型,开始明显向下参与动作控制。
首先发生变化的是空间推理。对于机器人而言,“认出桌上有一个杯子”远远不够。真正执行动作时,它还需要判断杯子相对于机械臂末端的位置,以什么角度接近可以避免碰撞,抓取后物体是否随着夹爪正确移动,放置时又该如何调整姿态。这些问题已经超出了传统视觉识别,更接近对三维空间关系的持续判断。
Astra 在 BenchCAD 上的表现正好体现了这一点。它可以根据多个视角的二维图像恢复出可计算的 CAD 几何结构,说明模型已经能够把不同画面里的局部视觉信息,组织成相对稳定的三维空间表征。这种能力一旦迁移到机器人上,就不再只是“看懂画面”,而是开始影响模型如何规划动作。
在一些机器人团队的实际测试中,研究者把具身任务进一步拆成语义泛化、空间泛化和物理泛化三个层面。
Astra 在前两个层面的表现已经相当突出,例如抓起散落的筷子,调整方向后再垂直插入狭窄杯口,这类需要精细三维对齐的任务,过去往往是通用视觉模型容易失手的地方。不过,一旦任务涉及物体持续形变、复杂受力或触觉反馈,它的表现就会明显下降。
另一项看似来自不同领域的能力,也开始迁移到机器人上:Computer Use,也就是模型操作电脑的能力。
从 Agent 的角度看,控制电脑和控制机器人其实有着相似的工作方式。在数字环境里,模型通过截图和软件状态判断当前进度,决定下一步点击哪里、输入什么,再根据结果继续操作;到了物理环境,它读取摄像头、本体状态和传感器数据,判断夹爪该移动到什么位置,并在动作完成后重新确认环境变化。
不管是在电脑里操作软件,还是让机械臂抓取物体,模型都不能只发出一次指令就结束,而是要不断观察结果、调整动作,再继续执行。核心都是同一套“观察—行动—反馈—纠错”循环。
这也是不少 Agent-as-Policy 实验采用的思路。模型接收到的不只有摄像头图像,还可能包括深度图、机械臂当前位姿、相机标定参数,以及底层控制器的接口说明。面对一个任务,Astra 可以自己编写代码,把画面中的像素位置换算成机器人坐标系中的三维坐标,再调用现成的几何计算库和控制接口完成动作。
这样一来,模型不需要从头学习所有机械运动学知识。很多已经成熟的几何计算、运动学求解和控制方法,都可以直接作为工具被调用。通用模型更像是在上层理解任务、组合这些工具,再根据执行结果决定下一步。
这类能力能够从数字世界迁移到机器人上,除了模型架构和工具调用方式的变化,也和训练数据有关。
过去一段时间,业内一直有前沿实验室大规模采购机器人遥操作数据和第一视角视频的消息,但 OpenAI 从未公开说明 Astra 是否接受过专门的机器人动作数据训练。
即使没有直接使用机器人数据,连续视频本身也可能承担一部分“弱动作数据”的作用。物体如何被接近、抓起和移动,操作前后的状态如何变化,都在持续向模型提供人与物理世界交互的先验。
OpenAI 早在 2022 年的 Video PreTraining(VPT)项目中,就曾用逆动力学模型从无标注的《我的世界》视频中反推出键鼠操作,再利用这些数据训练游戏策略。
从这个角度看,通用大模型在机器人任务中的能力,更像是多种基础能力叠加之后产生的结果。视觉理解、空间推理、代码生成和工具调用逐渐成熟,过去主要服务于数字世界的经验,也开始能够被迁移到物理任务中。
真实世界的边界:为什么机器人仍然需要专用模型
但一旦真正进入现实世界,这种迁移很快就会碰到边界。
RoboCurve 的双臂机器人实验就是一个典型例子。Astra 把红色积木放进一个大开口的碗里时,20 次尝试成功了 19 次;但当任务换成把圆形拼图片精准嵌入尺寸接近的凹槽,成功次数直接降到 2 次。
模型知道物体应该放在哪里,也能把机械臂移动到大致正确的位置,但到了最后几毫米,涉及接触、摩擦和精细对齐时,失败率就会明显上升。衣物折叠、柔性物体操作等任务也有类似问题,仅靠视觉和高层推理,很难准确判断细微形变、接触力和局部受力。
这里暴露出的是数字 Agent 和实体机器人工作方式上的根本差异。
软件世界大部分时候是离散的。模型收到一个状态,思考几秒,再输出一个操作,界面可以等它;但物理世界始终在变化。机械臂一旦开始运动,摄像头画面、关节位置和受力状态都会同步改变,新的信息以毫秒级速度持续产生。
有机器人从业者认为,这是因为数字世界里的模型习惯“一问一答”,而机器人面对的是连续不断的传感器输入,需要一边执行动作,一边实时处理新信息。
推理延迟也因此变得非常现实。语言模型逐 Token 自回归生成,在聊天场景里几十甚至几百毫秒的停顿几乎不影响体验,但放进机器人高频控制周期里,这段时间可能已经错过几次纠偏机会。
开头提及的 DrivingBench 的测试就体现了这个问题。Astra 成功跑完整条路线时,平均车速只有大约每小时 1.5 公里,整个过程消耗了约 660 万 Token。模型等待云端返回下一次推理结果时,车辆只能继续按照上一条控制指令低速前进。
在一些机械操作实验中,一次完整任务同样可能耗时数十分钟,并产生数十美元的 API 成本。这类实验证明了通用模型可以参与物理控制,但距离真实工业场景要求的速度、稳定性和成本还有明显差距。
因此,现阶段更可行的方案,可能不是让一个大模型包办所有动作,而是让不同模型各自处理擅长的部分。
在一项名为 GPT-as-Policy 的对比实验中,让 Astra 单独闭环控制机器人时,任务成功率只有 26%;当它与轻量级专用策略模型 π0.5 配合,由专用模型负责大部分高频动作,Astra 只在关键节点检查状态、遇到异常时重新介入,成功率提高到了 48%。整个过程中,Astra 实际介入的步骤只占 14.4%。
这组结果也说明,通用模型更适合负责理解目标、判断当前状态、处理异常和重新规划,而快速、连续的动作执行,仍然需要交给专用模型。
这种分层结构其实和人类学习动作技能的过程有些相似。第一次面对陌生任务时,人需要集中注意力,不断思考、判断和试错;随着动作逐渐熟练,其中大量环节会转为近乎自动化的执行,只有遇到异常情况时,才重新调动更高层的认知能力。
机器人也正在形成类似的分工。语义理解、开放词汇感知、空间推理、长程任务规划,以及失败后的反思和重试,越来越多由通用大模型负责;而高频响应、动力学平衡、力触觉融合,以及针对具体机械结构的运动控制,仍然更适合专用模型完成。
这种分层架构未来会长期存在,还是最终被统一的端到端模型吸收,目前还没有答案。但至少在现阶段,边界已经越来越清楚:大模型负责想清楚“要做什么”以及“出了问题怎么办”,专用模型则负责把动作快速、稳定地执行出来。
给通用智能接上不同的身体
如果沿着这一思路继续往前推,它影响的可能就不只是人形机器人或机械臂,而是整个物理设备的智能化方式。
DrivingBench 的实验依然是最好的例子。团队没有重新训练一套完整的自动驾驶网络,而是通过标准接口,把摄像头画面、车辆速度、转向和控制能力开放给模型。对 Astra 来说,一辆汽车和一台机械臂都可以被抽象成一组状态,以及一组可以调用的动作。
还有此前 Anthropic 推动的模型硬件标准 MHS(Model Hardware Standard),也在延伸类似思路。它试图为移液设备、离心机、显微镜和机械臂建立统一的通信方式,让 AI Agent 可以读取设备状态,并跨设备编排实验流程。
当底层硬件能力逐渐被封装成标准接口,上层模型就不必为每一种设备重新学习完整的操作逻辑。过去的机器人研发往往从一具具体的身体出发,再围绕它训练专门的大脑;现在,另一条路线开始出现:先构建足够通用的智能,再通过接口把它接到不同的物理设备上。
但这不会抹掉具身智能本身的技术壁垒。
毕竟真正进入现实部署后,机器人仍然要处理高精度力控、机械结构适配、软硬件联调,以及大量只能从真实物理交互中获得的数据。力矩变化、柔性材料形变、摩擦差异和机械磨损,都无法单靠互联网里的文字、图片和视频完整学会。
变化更可能发生在整个系统的能力分工上。
过去,一家具身智能公司往往需要从视觉感知、语言理解、空间建模一路做到动作规划和底层控制。现在,常识理解、空间推理、任务规划这些能力正在被通用模型快速吸收,专用具身模型的重心也随之向更靠近物理世界的部分移动:接触、力学、平衡、高频反馈,以及长期真实交互中形成的控制经验。
甚至大模型内部也可能进一步分工。最近走红的 Jev就代表了另一种方向,它不负责长链条推理和文本生成,而专门输出快速、结构化的判断。在机器人系统里,类似模型未来完全可能承担状态判断、策略选择和任务路由,再把复杂规划交给通用模型,把高频动作交给专用控制器。
Astra 没有让机器人自己的模型失去意义,但它正在改变这些模型需要解决的问题。未来的机器人依然需要自己的“运动神经”,也需要大量来自真实世界的数据和工程积累;只是语言、常识、视觉、空间理解和任务规划这套“大脑”,或许不需要每家公司都从头训练一遍。
1.https://openai.com/index/gpt-6-astra/
2.https://openai.robocurve.org/gpt-6-astra/
3.https://web.mit.edu/phillipi/www/writing/robot-use-agents.html
4.https://kairunwen.github.io/Awesome-Robot-Use-Agent/
注:首图/封面由 AI 辅助生成
热门跟贴