打开网易新闻 查看精彩图片

想象一位干了二十年的汽修老师傅,带一个刚进门的学徒。老师傅经验丰富,但如果学徒连螺丝刀都拿不稳,老师傅那些 "听声音就知道哪里坏了" 的绝活,讲了也是白讲 —— 徒弟根本接不住。可一旦徒弟练熟了基本功,老师傅的经验就会突然变得点石成金,让徒弟的水平一路飙升。等到徒弟自己都快出师了,老师傅再多的经验,能带来的提升也就有限了。

机器人学习里,藏着一个几乎一模一样的故事。

近日,千寻智能高阳团队的最新研究 《When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning》(老数据何时开始 "帮上忙"?跨配置机器人学习中的涌现式迁移)正式公开。这项工作揭示了一个反直觉的现象:在机器人硬件升级后,此前辛苦采集的 "老数据" 并不是拿来就有用,而是要等新硬件 "练到一定火候",才会突然开始发挥价值—— 而且价值大到惊人。

打开网易新闻 查看精彩图片

图1:跨配置共同训练的三阶段规律

打开网易新闻 查看精彩图片

  • 论文标题:When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning
  • 论文链接:https://arxiv.org/abs/2607.25593
  • 项目主页:https://xuezhiai123.github.io/legacy-data-transfer/

一个真实又昂贵的难题:

硬件一升级,老数据就 "作废" 了?

机器人要在真实世界里干活,就离不开大量的示教数据(人手把手教机器人怎么做的操作数据)。可现实是,机器人硬件一直在迭代:摄像头换成视野更广、更清晰的新款,夹爪换成更灵活的新设计。

问题来了:这些改动会直接改变机器人 "看到的画面" 和 "手上的动作方式"。于是每一次硬件升级,都会带来一个让人头疼的现实问题 ——

之前在旧硬件上花了大量人力、金钱采集的示教数据,还能用在新机器人身上吗?

一个很自然的想法是:把海量的老数据,和少量新硬件上采集的新数据混在一起训练(称为 "co-training / 共同训练"),让老数据 "扶一把" 新机器人。学界过去的工作(如 RoboNet、BridgeData)也确实表明,旧数据能降低新场景的数据采集成本。

但这些工作都没回答一个更关键的问题:硬件一换,老数据是不是从一开始就有用?迁移学习的经验反而提示我们:当新旧两边差异太大时,老数据不但可能没用,甚至会拖后腿、干扰学习。

反直觉的发现:

老数据不是 "越多越好",而是有个 "开窍时刻"

团队在一个轮式人形机器人平台上做了系统性实验 —— 跨越两代硬件,摄像头和夹爪都换了,但机器人整体形态不变。他们对比了两种策略的表现:

打开网易新闻 查看精彩图片

图2:真实机器人实验平台与操作任务(插花、插笔等精细操作)

  • 只用新数据训练的策略
  • 老数据 + 新数据共同训练的策略

结果非常出人意料。以 "插花" 这个精细操作任务为例:

  • 当新硬件数据只有 4.3 小时、机器人自己只能做到10%成功率时,加上老数据共同训练,成功率纹丝不动,还是 10%—— 老数据完全没帮上忙;
  • 但当新硬件数据增加到 15.6 小时、机器人自己能做到23.3%时,同样加上 17 小时老数据,成功率直接飙升到 86.7%—— 一举提高了 63.4 个百分点!

也就是说,仅仅是新机器人自身能力的一点点提升,就让老数据从 "毫无用处" 变成了 "点石成金"。

把不同任务、不同数据量下的结果汇总起来,一个清晰的 "三阶段规律" 浮出水面:

1.第一阶段(新机器人能力很低):老数据毫无用处,加了也白加;

2.第二阶段(能力跨过某个临界点):老数据的收益急剧爆发,带来巨大提升;

3.第三阶段(能力接近满分):老数据的边际收益又开始递减。

这个从 "没用" 到 "突然有用" 的跳变,团队称之为 "涌现式迁移"(Emergent Transfer)“。它和大模型领域大家熟悉的 "涌现能力""grokking(顿悟)"现象很像 —— 只不过这里的" 顿悟 ",不是靠堆模型规模或训练时间触发的,而是随着新硬件自身任务能力的提升而触发的。

打开网易新闻 查看精彩图片

图3:三阶段相变曲线。迁移阈值 τ(T) 标出了老数据开始产生显著收益的临界点。

为什么会这样?一个 "迁移阈值" 和背后的两套机制

团队用一个关键概念来刻画这个跳变:迁移阈值 τ(T)(transfer threshold)。

通俗地说,它就是 "徒弟必须先掌握的基本功水平"—— 只有当新硬件策略自身的成功率跨过这个任务相关的阈值,老数据才会开始帮上忙。

  • 阈值之下:新策略连任务的基本结构都没学会,给它再多老数据的 "高级经验",它也不知道怎么用;
  • 阈值之上:新旧数据的学习方向(梯度)开始 "对齐",老数据的经验能顺畅地迁移过来,于是收益暴涨;
  • 接近满分时:能提升的空间本就不多了,老数据的边际价值自然下降。

团队进一步从理论上给出了解释,核心是两套机制:

  • 梯度对齐(Gradient Alignment):解释了 "老数据何时开始帮上忙"—— 当新旧数据的梯度方向足够一致时,共同训练才不会互相打架,反而能相互增益;
  • 策略残余不确定性(Residual Policy Uncertainty):解释了 "老数据的收益为何在接近满分时递减"—— 当策略已经很确定时,老数据能补充的信息就所剩无几了。

  • 有什么用?一条 "看火候下菜" 的数据采集策略

这个规律最实在的价值,是能指导我们该怎么花钱采数据。

过去大家默认 "数据越多越好",一上来就大规模采集新硬件数据。但这项工作给出了一条更聪明的 "相位感知(phase-aware)数据采集策略":

先只采集新硬件数据,直到新机器人的能力跨过迁移阈值;然后再引入老数据做共同训练。

也就是说 ——先让徒弟练到 "开窍",再请老师傅出手,效果和性价比最高。

团队在一个全新的、没被用来推导规律的 "移动双臂浇花" 任务上验证了这套策略:

  • 按照相位感知策略,只需采集1.5 小时的新硬件数据(而按过去的做法需要8 小时);
  • 任务成功率从40.0%提升到78.3%。

用不到 1/5 的新数据采集量,换来了成功率的大幅提升—— 这对于动辄需要大量人工示教、成本高昂的真实机器人场景来说,意义重大。

打开网易新闻 查看精彩图片

图4:移动双臂浇花任务。相位感知策略把新数据需求从 8 小时压到 1.5 小时,成功率从 40.0% 升到 78.3%。

总结

这项工作系统性地揭示并刻画了跨配置机器人学习中的 "涌现式迁移" 现象,核心贡献可以概括为三点:

1.发现三阶段迁移规律:老数据在新硬件能力低时无用、跨过阈值后收益爆发、接近满分时收益递减,并给出了统计层面的支持;

2.提出迁移阈值 τ(T) 与理论解释:用梯度对齐和策略残余不确定性,讲清了老数据 "何时开始有用" 以及 "为何后期收益递减";

3.给出可落地的数据采集策略:先采新数据跨过阈值、再引入老数据共同训练,在浇花任务上把新数据需求从 8 小时压缩到 1.5 小时。

对于正走向大规模真实世界部署、且硬件不断迭代的具身智能来说,这项工作回答了一个既基础又实用的问题:面对硬件升级,我们究竟该在什么时候、以什么方式,去复用那些昂贵的历史数据。

作者简介

该工作产自于千寻智能后训练团队,该团队承担起千寻智能Manipulation Model的后训练和强化学习工作。该团队团队成员来自清华、北航、苏黎世联邦理工等高校,多位拥有博士学位。团队背景覆盖大模型、具身智能与自动驾驶,核心成员曾任职于百度、小米等企业,长期深耕模型后训练,兼具算法研究与工程落地经验。