最近,人形机器人越来越频繁地出现在新闻里。

有的能跑马拉松,有的能跳舞、打武术,还还有一些已经进入工厂试点,在相对明确的流程中参与搬运零件、物料分拣或简单装配。它们动作越来越流畅,也越来越像人。于是,不少人开始产生一种印象:机器人是不是已经越来越聪明了?

打开网易新闻 查看精彩图片

春晚上打武术的机器人

图片来源:央视

但如果把这些机器人带到一个完全陌生的环境,结果可能和想象中不太一样。一扇从未见过的门、一个位置改变的杯子,或一条突然被杂物挡住的通道,都可能让机器人识别变慢、动作犹豫,或者需要重新规划;在一些情况下,它也可能无法完成任务。难点不一定在于“开门”这个动作本身,而在于它能否判断门把手的类型、门的开合方向、是否需要施力,以及周围是否存在碰撞风险。

为什么会这样?难道机器人已经学会了奔跑、抓取,却还不会开门?

这并不是机器人“笨”,而是因为现实世界,远比实验室复杂得多。今天机器人研究真正面对的挑战,也早已不是让机器学会某一个动作,而是让它能够在不断变化的环境中识别情况、调整动作,并尽量安全、稳定地完成任务。

这也是为什么,中国科协将“具身自主智能的度量与演化”列为2026重大科学问题之一。

机器人最大的敌人,其实是“第一次见”

我们经常看到机器人完成各种令人惊叹的展示:稳稳端起一杯水、灵活搬运货物、连续翻跟头……

打开网易新闻 查看精彩图片

2026北京亦庄半程马拉松暨人形机器人半程马拉松比赛中奔跑的机器人

图片来源:北京亦庄

这些动作当然不简单,但对于机器人来说,更困难的往往不是动作本身,而是环境发生变化以后怎么办。

对于一个普通人来说,当你走进一家从没去过的咖啡馆。桌椅摆放和平时不同,门把手不是常见的下压式,而是需要旋转;柜台上的杯子有高有低,地上还有顾客临时放着的背包。

这些变化几乎不会影响你完成“点一杯咖啡”这件事。因为你会一边观察、一边调整,发现门打不开,就换一种开法;发现路被挡住,就绕过去;杯子放得高一点,就踮一下脚。这些动作看似简单,却没有任何一步是提前写好的。

打开网易新闻 查看精彩图片

面对熟悉环境,人类可以依靠经验快速调整行为;但对于机器人而言,一个从未见过的门把手、物体摆放方式或障碍物,都可能带来新的判断挑战。如何在陌生环境中自主感知、学习和适应,是具身智能发展的关键问题。

图片来源:AI生成

机器人面对的却是另一回事。

对于机器来说,每一种变化都意味着新的问题:门把手形状改变,意味着原有的识别和抓取方法可能不再适用;杯子位置变化,意味着它需要重新定位目标、规划手臂路径,并避免碰撞。如果这些情况没有出现在训练中,它就可能不知道下一步该怎么办。因此,机器人真正害怕的,不是任务复杂,而是第一次遇见。

“第一次见”往往意味着缺少可直接套用的经验。它未必完全无从下手,但完成任务的把握通常会降低。一次精彩的演示,可以证明机器人完成了一个动作,却不能说明它已经能够适应真实世界。

真正困难的,不是动作,而是和世界“打交道”

很多人以为,机器人工作就像执行一条指令:看到杯子,伸手抓起,再放到指定位置。

现实远没有这么简单。人类拿起一个杯子时,整个身体都在不停工作。

眼睛观察杯子的位置,手指根据重量调整力度;发现杯子有点滑,就换一种抓法;身体感觉重心发生变化,又会下意识调整姿势。哪怕只是倒一杯水,大脑和身体也一直在交换信息。

机器人也是如此。

摄像头最先获得的是图像数据,而“这是不是一个杯子、杯口朝向哪里、能不能抓、该从哪里抓”等判断,需要机器人进一步分析;同时机器人需要依靠触觉、视觉和机械手的受力信息,判断东西有没有抓稳,并随时调整力度;如果有人突然从旁边经过,它还需要重新规划路线。

打开网易新闻 查看精彩图片

人类看似简单的抓取动作,背后包含视觉判断、力度控制和身体协调等复杂过程。具身智能机器人需要通过感知、决策、行动和反馈不断调整,才能真正与真实世界互动。

图片来源:AI生成

更重要的是,这些判断并不是先全部完成,再开始行动。它是一边观察,一边行动;一边行动,又一边根据新的信息不断修正。这类“通过身体与环境互动,在行动中获取信息并调整行为”的研究方向,通常被称为具身智能(Embodied Intelligence)。简单说,具身智能关注的不只是“机器会不会回答问题”,还关注它能否借助摄像头、机械手、轮子或双腿,在真实环境中看、摸、走、抓,并根据结果调整下一步行动。

这并不是说身体会自己思考,而是说身体的形状、关节、传感器和与环境接触的方式,会影响机器人能够获得哪些信息、能够采取哪些动作,以及它解决问题的难易程度。

机器人并不是总要先把所有情况想清楚再行动。更常见的过程是:它先根据现有信息做出尝试,再根据新的视觉、触觉和受力信息及时修正动作。

需要注意的是,这种“边做边改”不一定等于真正记住经验、长期学会新技能。有些机器人只能在当前任务中即时调整;要让它在下次遇到类似情况时做得更好,还需要把经验记录、训练和验证。

为什么身体也会“思考”?

这个观点听起来有些反直觉,但科学家早就发现,很多智能并不是只来自“大脑”。

打开网易新闻 查看精彩图片

赫尔德(Richard Held)和海因(Alan Hein)1963年的“小猫运动诱发视觉发育实验”图示

图片来源:simplypsychology

20 世纪 60 年代,一项著名的小猫实验给出了重要启发。研究人员让两只小猫在装置中获得相似的视觉经历:其中一只可以主动移动,另一只则会随着前者被动移动。

后来,能够主动移动的小猫在避开障碍、根据看到的情况调整动作等任务上表现更正常;被动移动的小猫虽然看到了相似的画面,却较难把“看到什么”和“自己该怎么动”联系起来。

这项实验提示我们:学习并不只是接收信息。主动行动,以及看到自己的行动带来什么结果,也会帮助生物建立对环境的认识。

机器人也是如此。它抓起一个物体,发现太滑;下一次就会调整力度。它绕过障碍物时发现路线不通,又会重新寻找新的路径。每一次尝试、每一次失败、每一次修正,都在帮助它建立对真实世界更准确的理解。

打开网易新闻 查看精彩图片

2025北京亦庄人形机器人半程马拉松比赛过程中,人形机器人也会在跑步过程中摔倒

图片来源:央视新闻

因此,今天的机器人研究越来越强调,不只是让机器“知道”世界是什么样,更要让它在真实环境中不断探索、不断适应。

比“会做”更重要的是“会适应”

过去,人们评价机器人,喜欢看一些容易量化的指标:跑得多快、举得多重、动作有多精准。如今,越来越多科学家开始关注另一个问题:如果把机器人放到一个从没见过的新环境,它还能完成任务吗?

这是比“会不会做”更难的一道题。同样是搬运箱子,箱子的大小、材质、重量可能每天都不同;同样是装配零件,工件的位置、形状甚至光线条件都可能发生变化。真实世界没有固定剧本,也很少存在唯一正确的答案。

因此,除了速度、力量和动作精度,机器人研究如今也越来越重视另一项能力:面对环境变化时,能否保持可靠、安全和稳定的表现。

打开网易新闻 查看精彩图片

清华大学的研究人员正在使用具身智能框架训练机器人。

图片来源:清华大学

这也是为什么,科学家开始讨论如何衡量具身自主智能:评价的不再只是动作是否成功,而是机器人面对陌生任务时,能否自主观察、理解、调整,并从经验中继续学习。

给AI一副身体,也许才是真正的开始

过去十多年,人工智能取得了巨大进步。大语言模型擅长处理文字;结合图像、语音等能力的多模态模型,也越来越能描述和分析屏幕上的信息,仿佛拥有了一颗越来越聪明的“大脑”。

但真实世界不只有文字、图片和声音。它还包含重量、摩擦、软硬、温度、距离、速度,以及随时可能出现的人和障碍物。这里有会移动的人、有会打滑的地面、有形状各异的工具,也有数不清的意外和变化。对于机器人来说,学会在这样的世界里行动,远比回答一道问题困难得多。

打开网易新闻 查看精彩图片

在《底特律:化身为人》中,机器人已经能够像人一样生活、工作并与人类互动。现实中的机器人尚未达到这样的水平,但未来人工智能的发展,或许不仅是让机器拥有更强的“大脑”,也包括让它们拥有理解和适应世界的“身体”。

图片来源:游戏《底特律:化身为人(Detroit: Become Human)》

所以,未来机器人最重要的突破,也许不是跑得更快、跳得更高,或者完成更多精彩的表演,而是在面对未知时,依然能够像人一样观察环境、修正动作、积累经验,并在一次次与现实世界的互动中不断成长。

当然,具身智能并不意味着机器人很快就会像人一样无所不能。现实中的机器人仍会受到电池续航、机械结构、传感器精度、计算速度、安全要求和训练数据等限制。它们在固定任务中可能表现出色,但在开放、拥挤、充满意外的环境里,距离人类的适应能力仍有很大差距。

真正有价值的进步,不是让机器人在演示中偶尔成功一次,而是让它在更多普通场景中,稳定、安全、可重复地完成任务。

如果说,过去十年人工智能的发展,更多是在打造越来越强大的“大脑”;那么未来十年,一个更加重要的问题或许是:如何让这颗“大脑”,真正学会与真实世界相处。

这,正是具身智能试图回答的问题。

作者:蝌蚪君

审核:刘颖 李培元 张超 杨柳

审核专家:兰名荥 北京邮电大学数字媒体与设计艺术学院副教授、信息通信全国科普教育基地副主任

打开网易新闻 查看精彩图片