打开网易新闻 查看精彩图片

7 月 30 日,谷歌 DeepMind 发布新一代机器人基础模型系列 Gemini Robotics 2。相比上一代 Gemini Robotics 只能控制机器人上半身完成桌面任务,此次更新的最关键变化在于,一个视觉-语言-动作(VLA)模型首次实现了对完整人形机器人的控制,覆盖从双腿到手指的全身自由度,并在多个形态迥异的硬件平台之间共用同一份模型权重。

DeepMind 机器人负责人卡罗琳娜·帕拉达(Carolina Parada)自豪地表示,这是“驱动下一代真正可适应机器人的智能层”。

弥合两个能力断层

过去几年,机器人行业存在两个明显的能力断层。

其一是控制的分层。具备复杂运动能力的人形机器人,传统路线如波士顿动力(Boston Dynamics)的阿特拉斯(Atlas)等,其行走、平衡等各项能力由基于模型预测控制或强化学习训练的独立控制器分别负责。即便是新一代基于学习策略的机器人,包括 Figure、特斯拉(Tesla)等厂商的产品,也仍普遍将行走控制器与操作策略分开部署。

这种拼接式架构在演示视频中效果尚可,但在真实开放环境中,两个系统之间的协调经常出问题,机器人难以自然地“边走边做”。

第二个是跨硬件迁移的门槛。传统机器人策略往往针对特定形态训练,一旦更换自由度、传感器、末端执行器不同的其他机型,大部分能力需要重新采集数据、重新训练。这使整个行业陷入重复劳动,通用模型难以形成规模效应。

为弥合两大断层,谷歌此次发布了 Gemini Robotics 2,这是一个包含三个部件的模型家族。

其中,Gemini Robotics 2 是 VLA 主力模型,负责将摄像头输入与自然语言指令直接转换为电机控制信号。它是 DeepMind 旗下首个能够端到端控制人形机器人全部自由度的 VLA 模型。在演示中,同一个模型检查点可以驱动三种不同的机器人本体:Apptronik 的 Apollo 2 搭配 SharpaWave 手、Apollo 2 搭配 Inspire 手,以及双臂平台 Franka Duo 搭配 Robotiq 夹爪。

(来源:谷歌)
打开网易新闻 查看精彩图片
(来源:谷歌)

Gemini Robotics ER 2 则是负责具身推理(简称 ER)的视觉语言模型。作为整套系统的高层规划者,它接受自然语言指令,处理连续视频流,将复杂任务拆解为可执行的子任务序列,监控执行进度,在失败时触发重试或求助人类。它通过 Gemini Live API 的双向流式接口与 VLA 通信,可以在当前动作执行的同时提前推理下一步,从而避免“想一步、停一步”的延迟。

Gemini Robotics On-Device 2 是端侧 VLA 模型,专为无网络或对延迟敏感的场景优化,可直接部署在机器人本地芯片上运行。该模型继承自 Gemini Robotics 1.5 的运动迁移技术,即便新机器人平台在形状、传感器与自由度上与训练分布差异显著,该模型也能在不到 200 个演示样本、几小时时间内完成适配,大大降低了部署难度。

三者的分工关系类似于项目负责人与执行团队:ER 2 承担理解意图、拆解任务、编排流程的角色,VLA 或 On-Device 2 负责将具体动作输出到关节。这种分层的好处是,ER 2 不需要感知底层硬件的物理细节,更换机器人本体时,它的适应性几乎不会受到影响。

能力细节与真实差距

在 DeepMind 展示的样例中,最受关注的是模型驱动的机器人全身运动控制。接收到“把浇水壶放到底层货架的绿色箱子里”的指令后,Apollo 2 自主完成了走向桌子、拾取物品、走向货架、精确放置的完整流程,全程无需人类进一步拆解步骤。

不过,这一策略目前仍然存在显著的局限:Apollo 2 从桌面拿取物品的平均成功率为 68.4%,从地面拿取为 45.7%,从货架拿取为 76.3%。移动速度在演示视频中肉眼可见地偏慢。全身控制的闭环已经跑通,但离稳定可靠仍有明显距离。

针对不同的机器人手部形态,Gemini Robotics 2 的表现并不稳定。其操纵两指平行夹爪的 Franka Duo 完成通用抓放(74.2%)、工具分拣(78.9%)以及精密插入(89.6%)等任务的成功率较高。

但多指灵巧操作目前仍是薄弱环节。SharpaWave 是一只五指、22 自由度机械手,可以完成大量精细动作。但在实际验证中,Gemini Robotics 2 系列指挥 SharpaWave 拧下灯泡的成功率约为 92%,装上灯泡的任务成功率骤降至 36%,垃圾袋打结(44%),密封拉链袋(40%),使用簸箕(32%)等场景表现也不佳。

(来源:谷歌)
打开网易新闻 查看精彩图片
(来源:谷歌)

此外,在 Gemini Robotics 2 中,谷歌首次为模型引入了协调不同形态机器人开展合作的能力。不依赖预设的通信协议,机器人之间可通过共享语义理解传递子任务。在演示中,Apollo 2 与 Franka F3 Duo 联合完成了单机无法胜任的工作流。

为何要发展协作能力?DeepMind 表示,目前没有一款机器人在所有任务中都表现最优,例如,轮式底盘擅长室内平地移动,人形机器人擅长应对起伏地形。但通过 ER 2 的协调,异构机器人可以按各自的长处实现分工,合作完成任务。

随着机器人物理能力增强,行为边界的可控性成为部署的前提。DeepMind 此次同步发布了 ASIMOV-Agentic 基准,用于衡量智能体在具身场景下的安全编排能力。其中,ER 层可拒绝来自 VLA 层的不安全工具调用、预测任务是否可行、以及在不确定时主动请求人类介入。该数据集已在 Hugging Face 开源。

在协作安全方面,ER 2 借助增强的空间推理能力,可在原始视频流上实时检测人类是否过近,并触发安全工具调用让机器人平稳停止。该系列被 DeepMind 称为迄今最安全的机器人模型。

空间推理层面,ER 2 相比前代也有显著改进。例如,对任务成功与失败的检测,从此前的静态截图判断转向连续视频输入,这使模型能够捕捉执行过程中发生的液体洒出、物品滑落等中间事件;仪表读数能力从圆形刻度盘扩展到数字显示屏、直尺、液体温度计等 10 类仪表;空间视觉问答功能也基于 Gemini 多模态能力进行了升级。

行业格局中的位置

Gemini Robotics 2 的全身控制并非行业首创。2026 年 1 月,Figure 发布的 Helix 02 采用 System 0/1/2 三层架构,通过单一学习策略直接控制人形机器人从腿、躯干、手臂到每根手指的全部自由度。其中,Helix 02 独创了一个名为 System 0 的“全身运动先验层”,以 1kHz 高频运行,专门负责平衡与物理可行性。

Figure 展示的四分钟连续洗碗任务,从走到洗碗机、卸盘,到跨过房间、堆叠、装载、启动,包含 61 个连续动作,在长时序端到端全身控制的完整度上超过 DeepMind 此次演示。

(来源:Figure)
打开网易新闻 查看精彩图片
(来源:Figure)

Gemini Robotics 2 相对 Helix 的差异主要体现在硬件适配方面。Helix 全程绑定 Figure 自家人形机器人,仅供内部使用,不向第三方硬件开放;Gemini Robotics 2 则可以用同一个模型检查点同时驱动不同的第三方平台。

在通用性方面,Physical Intelligence 在今年 4 月发布的 π0.7 主打组合泛化,将不同上下文中习得的技能重组解决未训练过的新任务,与 Gemini Robotics 2 用同一权重直接跑通不同硬件的思路各有侧重。不过,π 系列目前主要覆盖操作层,尚未展示与 Helix 02 或 Gemini Robotics 2 同级别的下肢-操作联合控制。

综合来看,Gemini Robotics 2 的独特之处在于,其不仅实现了跨异构厂商硬件的单权重运行,还将推理层开放给开发者。只是这些能力能否转化为实际生产力,仍需更长时间的部署检验。

截至目前,ER 2 已在 Google AI Studio 上开放使用,同时以私有预览形式接入 Gemini Enterprise Agent Platform。VLA 主力模型和 On-Device 2 仅面向早期合作伙伴开放,部署伙伴包括 Apptronik、Franka 以及敏捷机器人(Agile Robots)。

卡罗琳娜在发布中提到,他们的目标是“把 AI 带入物理世界,并构建每个机器人都能使用的智能层”。

此次发布的三个模型在通用性与实用性两个维度上虽然都还有明显短板,但从架构层面看,它验证了一个颇具潜力的方向:人形机器人行走与操作的分层拼接,未来将在同一模型内走向协同。

参考内容:

https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成