研究人员先教机器人拿起刷子,把桌上的积木扫进碗里。机器人抓起香蕉,将它横过来贴住桌面,把积木一点点扫进碗中。随后,香蕉被换成簸箕,机器人没有继续照搬「扫」的动作,而是伸出另一只手,把积木推上簸箕,再端起来倒进碗里。
重点在于,研究人员从来没有在这项任务里教它用香蕉和簸箕,它是自己推理出来的。这是 Generalist 最新发布的 GEN-1.5 具身基座模型展现出的能力:模型开始从大规模人类操作数据中天然存在的重复、失误与恢复中,学习到训练者没有逐项教过的动作,显露出某种智能涌现的迹象。
物理提示:看一次就会
真正让机器人研究者兴奋的,是 GEN-1.5 还展示了一项新能力,它称之为「physical prompting」——物理提示。研究人员可以拿着一对简易夹爪完成一项 3 到 12 秒的操作,只需向机器人演示一遍,GEN-1.5 不进行微调,也不更新任何参数,随即开始在新的物体位置和初始状态下尝试同一项任务。
曾参与 Google DeepMind Gemini Robotics 的研究者 Ted Xiao 将这种「让机器人看一次示范,就立刻学会一项新任务」的能力称为机器人领域追寻多年的「圣杯」。在他看来,GEN-1.5 是这条路线上迄今最好的结果,那种能力突然跃升的感觉,让他想起第一次使用 GPT-3。
能够进行物理提示也说明 GEN-1.5 的基座模型已经足够强。3 到 12 秒的示范不可能从头教会机器人如何抓取、接触和控制物体,只能告诉它「现在要做什么」。用 Generalist 的说法,这更像是在提醒模型一件它几乎已经会做的事。
与大语言模型的相似之处
这些瞬间之所以打动人,是因为它们和熟悉的机器人形成了鲜明反差。过去的机器人演示往往动作缓慢、环境固定,物体位置或工具稍有变化就可能失败。它们像是在忠实复现一条训练过无数次的轨迹,而不是理解自己最终要完成什么。
而这一次,机器人给人的感觉开始有点像大语言模型了。大语言模型真正令人惊讶的,往往不是它复述出了标准答案,而是面对一个新问题,它会给出一种人没有写进提示词里的回答。这个回答未必更聪明,甚至未必正确,但你能感觉到,那是模型根据问题自己组织出来的。
Generalist 也有意把这种变化与 GPT-3 相比。GPT-3 之前,语言模型已经偶尔表现出看几个例子就能完成新任务的能力;GPT-3 的不同,在于这种现象突然在广泛的任务上变得明显。只看一个例子,它的平均准确率约为 45%;看到约 100 个例子后,可以达到约 65%。
押注物理智能可以 scaling
Generalist 并不是具身智能创业潮中公众最熟悉的公司。它不生产一款像 Figure 那样不断出现在聚光灯下的人形机器人,而是试图为不同形态的机器人训练同一种底层智能。但在机器人研究和产业圈,它一直是被密切追踪的公司之一。
原因是,它几乎把过去两年的全部赌注都压在同一个判断上:物理智能也可以 scaling。2025 年 11 月,Generalist 用 GEN-0 展示,增加真实物理数据、模型规模和计算量,可以让一组下游任务共同进步;2026 年 4 月,数据规模超过 50 万小时后,GEN-1 将若干简单任务的平均成功率从上一代的 64% 推到 99%。
此次 GEN-1.5 的发布,同时伴随着 Generalist 宣布学习新任务所需的训练正在消失。所谓一次「梯度更新」,就是用新任务的数据调整一次模型参数。Generalist 将这个过程从过去的数百次,压缩到数十次、10 次、1 次,最终变成 0 次:模型不再需要重新训练,看一遍就能开始做。
目前,GEN-1.5 只看一次示范,在 10 项新任务上的平均成功率为 59%;使用 5 分钟数据、调整 10 次参数后,可以提高到 83%。它离一台可以放心交付工作的机器人还有距离,但它已经出现在一条清晰的 scaling 曲线上。
三种学习新能力的方式
Generalist 这次一共展示了 GEN-1.5 学习和使用新能力的三种情况。
第一种,是面对没见过的变化,直接换一种办法。机器人学过把积木放进碗,但没有见过碗被纸盖住,它会先移开纸;乐高卡在一只夹爪上,它会用另一只手取下;只学过单手开罐,有时也会换成双手。这里没有重新提供数据或训练模型,任务本身学过,变化没有学过,GEN-1.5 展示的是对新工具、新障碍和意外情况的直接泛化。
第二种,是只看一次示范,就开始做一项新任务。研究人员在机器人面前拉开一次拉链、拧开一次罐盖,或者从钱包里抽出一张纸币。演示只有 3 到 12 秒,GEN-1.5 随即开始尝试,无需任何参数更新。
第三种,是少量数据加少量训练,快速适应新任务。当一次示范不够时,研究人员提供约 5 分钟的新任务数据,并调整 10 次参数,GEN-1.5 就能将成功率从 59% 提升到 83%。
机器人的智能涌现,已经近了。
热门跟贴