就在刚刚,机器人领域学术顶刊、Science子刊《 Science Robotics 》(科学机器人)发表了中国学者的重要成果。
7月23日消息,智能纪元AGI独家获悉,上海期智研究院、上海交大、清华、港大、中科院自动化所等团队近日联合发表论文“Performant robotic manipulation with real-world reinforcement learning”( 利用现实世界强化学习实现高性能机器人操作 )。
具体来说, 该团队提出 真实机器人AI强化学习(RL)框架RL-100,解决传统模仿学习存在的“模仿上限”问题。利用该技术,实现真实场景机器人操作100%任务成功率、媲美甚至超越人类遥操的效率与极强环境鲁棒性。
例如在案例中,一台基于RL-100机器人可以为随机顾客连续7小时无故障地制作新鲜橙汁,而非Demo演示。
(注:原视频基于1倍速,由于gif上传要求,我们进行10倍速剪成gif图)
本论文第一作者和通讯作者之一是上海期智研究院与上海交通大学联合培养的博士生Kun Lei(雷坤)。
本论文通讯作者、雷坤的导师,是清华大学交叉信息研究院助理教授、上海期智研究院PI、破壳机器人创始人、CEO许华哲。
具体来看,灵巧的机器人操作是机器人学中的一个显著挑战。在实验室之外的实际部署需要高可靠性、高效率和强鲁棒性。
近年来,基于学习的方法在生成式扩散策略、基于扩散的机器人基础模型、仿真到现实的强化学习(RL)以及现实世界RL方面取得了进展,缩小了这一差距,机器人手臂展示了类似人类的操作能力,特别是收集了大量真实人类的机器人数据集进行训练和微调,最后形成机器人 遥操 方案。
然而,高质量的真实机器人数据仍然稀缺,遥操作存在感知和控制延迟,倾向于缓慢、保守的运动。此外,大规模数据收集依赖于熟练操作员,劳动密集且成本高昂。因此,状态‑动作覆盖范围有限,削弱了泛化能力和可靠性。
所以,这种模仿学习的方案有很多上限“天花板”的制约:在纯监督目标下,性能实际上受限于演示者的技能,并继承人类的低效、偏见和偶尔的错误。
而强化学习RL通过优化交互回报而非模仿保真度提供了一条互补路径,从而能够发现人类演示中罕见或缺失的策略。同时,仿真到现实的RL必须应对仿真与现实之间的视觉和动力学差异,而直接在真实硬件上训练基于学习的生成策略既危险又样本效率低下。
这引出了一个核心问题:我们如何构建一个既能利用强大人类先验知识,又能通过自主探索持续自我完善?
一个有用的类比来自人类学习:婴儿在父母监督下学习走路,然后自己强化这一技能,直到精进并最终在不同地形上迁移,实现走路。
类似地,一个可泛化的机器人学习系统应当将熟练的人类先验知识与自我改进相结合,以接近或超越在特定指标上人类演示的性能。
因此,许华哲团队研发RL-100,一个在基于模仿的扩散策略(DP‑2D)之上,采用真实世界强化学习后训练阶段的框架。
简单来说,RL-100就对应三个阶段步骤:人类演示预训练IL→离线RL自主迭代优化→真机在线RL微调消除边缘失败。
第一阶段,模仿学习 IL 预训练(人类先验初始化)。RL-100包含三个具有不同角色和成本的阶段: 基于遥操作演示的模仿学习(IL)预训练产生一个稳健、低方差的策略,将行为锚定在安全、类人的动作上; 在策略回滚的不断增长的缓冲区上进行迭代离线强化学习后训练,在迭代中实现了成功率和效率提升; 而短暂的在线策略强化学习,将大部分学习预算分配给迭代离线更新,并使用少量有针对性的在线预算,将性能从高成功率(90%)提升到接近完美的可靠性(99%+)。
第二阶段,迭代式离线 RL(性能提升主力阶段)。RL‑100基于视觉的设置中运行,通过简单地交换观察编码器,无需修改框架的其他部分,即可支持三维(3D)点云和二维红绿蓝(RGB)图像。同时,研发人员引入了一种专为RL后训练量身定制的自监督视觉编码器,该编码器在策略探索和更新过程中提供稳定、任务相关的特征以及对齐方式。此外,团队还在其中穿插了一个轻量级的蒸馏损失,将K步扩散策略压缩为一步一致性策略用于部署,减少推理延迟,同时保持或提高效率和鲁棒性。
最后一个阶段,是在线On-Policy RL(最后一公里完美化)。仅用少量真机交互,针对离线阶段遗留的罕见失败场景微调,沿用与离线完全一致的 PPO 统一损失,跨扩散全部去噪步骤共享环境优势函数,提供稠密梯度信号;而且使用广义优势估计函数( GAE )计算奖励梯度,消除全部残余失败,所有任务达成 100% 评估成功率 。
此外,RL-100还配套轻量化部署技术,实现一致性模型蒸馏(CM),将推理速度提升 10 倍(100ms→10ms),不损失任务性能,部署时支持高频闭环控制,而在榨汁移除任务,因逆运动学不稳定性未评估 CM,其余 7 项任务 CM 均实现 100% 成功率。
下面,团队进行了实验和基准测试。
论文提到,由于最终目标是在家庭和工厂中部署,团队更强调以部署为中心的指标:可靠性(成功率)、 效率(完成时间)和鲁棒性(长时间部署和干扰下的持续稳定性)。
具体来说,RL-100进行共8类真实机器人操作任务,覆盖刚体、流体、软质变形物体、精密装配、双臂长时序协调,硬件包含 UR5、Franka 灵巧手、xArm 双臂平台。
Push-T:高精度非接触推块(稠密塑形奖励)
Bowling:动态保龄球击打
Pouring:颗粒 / 液体倾倒流体控制
Unscrewing:灵巧手拧螺丝精密装配
Soft-towel folding:双臂软毛巾折叠(250 次连续无失败)
Juicing placing:橙子榨汁放置
Juicing removal:榨汁后取果(逆运动学难点)
Box folding:长时序双臂纸盒折叠(误差累积最困难任务)
根据示例中,基于RL-100框架的机械臂可以自主寻找保龄球位置,用非接触式方式动态击打保龄球。
倒杯子也是如此。在不需要遥操的情况下,机器人可以自主寻找盘子的位置。
另一个叠毛巾的演示中,两只机械臂可以相互配合运作,将毛巾顺利抖落平整,然后再进行折叠。
真实世界实验表明, RL‑100 在所有八个任务的评估试验中达到了100%的成功率,并保持了长期稳定性。
其中,从模仿基线到 100% 完美执行,纯模仿 DP-2D 平均 45.3%、DP3 平均 67.8%;迭代离线 RL 后平均 91.8%;完整 RL-100(离线 + 在线 DDIM/CM)所有任务 100% 成功,总计 1000 次评估 episode 全部完成;毛巾折叠任务达成 250 次连续无失败。
在执行效率方面,RL‑100接近人类遥操作的完成时间,并且在多个任务上达到甚至超越了熟练操作员。
环境步数,相比 DP-2D,RL-100纸盒折叠任务减少 52% 步数(1.52 倍提速),纸盒折叠 DP-2D 需 65.1s,RL-100 (CM) 仅 41.4s,1.57 倍更快。对比人类操作员,Push-T 同等时间内,RL-100 完成 20 次成功,人类专家 17 次、新手仅 13 次;保龄球 25 次对抗中机器人 25 次全中,人类最高仅 14 次;而蒸馏 CM 单步控制器进一步降低 1.05~1.16 倍推理时延。
最后是泛化与抗干扰鲁棒性(无重训 / 少量微调)方面,机器人零样本自适应(无任何重训练,平均 90% 成功率),倾倒颗粒坚果换清水流体 90%;Push-T改变桌面摩擦力 100%、增加杂乱障碍物 80%;保龄球更换滚动台面 100%;毛巾折叠,全新毛巾外形 80%;纸盒折叠:全新纸盒、大角度初始位姿 90%。 总结来说,少样本微调下,(1~3 小时少量训练,平均 86.7%)新材质毛巾折叠 100%、球瓶倒置保龄球 100%、全新容器倾倒 60%的泛化和抗干扰鲁棒性。而在人类帮助机器人进行折叠、拧螺丝、推块、纸盒折叠等任务,在抓取、预操作、执行全程施加外力干扰,仍可稳定恢复完成任务。 此外, 真实场景落地验证层面,RL-100的机器人可以在商场公共环境零部署榨汁机器人 连续7小时服务顾客,中间没有任何故障 ,证明实验室外开放环境长期稳定运行能力。
而在训练样本效率上,单任务平均仅需 126 个人类演示片段(1.9 小时采集);后续自主离线回放 572 段(6.8h)、在线微调 403 段(5.3h);人工数据仅占总训练时长 14%,绝大多数数据由机器人自主采集,大幅降低人力成本。
至于研究的局限性和未来工作,论文提到,当前RL-100研究局限在于,实验仅覆盖有限实验室标准化任务,未完全覆盖极端杂乱、部分观测、超长时序家庭复杂场景;训练、故障恢复仍需大量人工复位干预;并且未在跨机器人本体、跨领域通用大模型上规模化验证。
未来方向上,研究将围绕自动化故障复位、失败感知自动数据采集,降低人工干预;扩展至视觉语言动作(VLA)多任务基础模型,研究模型规模、数据量与真机样本效率缩放关系;以及统一跨机器人硬件、跨场景通用策略,强化零样本跨任务泛化等。 针对本研究成果,《科学机器人》另一篇同行评议文章、瑞典厄勒布鲁大学教授Johannes A. Stork评价称, 这篇论文超越了模仿学习,让机器人实现在现实世界中学习和工作。RL‑100一个成功率达100%的操作框架,指明了一条不同的路径:它从模仿开始,但学习并不止步于此。人类演示提供了初始能力;随后在真实机器人上进行的强化学习进一步推动这种能力的提升。在这种观点下,模仿不是机器人学习的终点,而是学习的起点。
目前, RL-100框架已开放代码。
本论文作者雷坤,是姚期智院士的上海期智研究院(清华大学)与上海交通大学联合培养项目的博士研究生,本科毕业于西南交通大学,博士研究生导师是清华大学的徐华哲教授。此前,他曾在上海期智研究院担任研究助理,以及曾在西湖大学进行过四个月的研究实习。
许华哲,清华大学交叉信息研究院(IIIS)长聘助理教授、博士生导师, 清华具身智能实验室(TEA Lab)负责人,同时担任 上海期智研究院 PI。本科毕业于清华大学电子工程系(EE),博士在加州大学伯克利分校 BAIR 实验室(全球顶尖机器人/强化学习实验室),导师为Trevor Darrell,博士后期转向机器人灵巧操作、扩散模仿学习方向,博士后前往斯坦福大学 SVL 视觉学习实验室,师从吴佳骏教授,深耕视觉 - 机器人交互等研究。
2022年,许华哲回国,正式加入清华大学交叉信息研究院,回国组建 TEA Lab;被业内称为“伯克利归国四子”之一( 吴翼、高阳、许华哲和陈建宇 )。
2023年,许华哲,与赵行、 高继扬 等人联合创立 星海图 ,担任 首席科学家 ,主导底层机器人算法体系搭建。
2026年2月,星海图证实,许华哲已离开星海图。
随后,许华哲创办了面向家庭服务机器人的创业公司 破壳机器人 ,担任CEO,聚焦家用通用机器人落地。
目前, 破壳机器人已完成数千万美元天使轮融资,由云启资本领投,并获得顺为资本、弘晖基金等一线美元基金,小米战投、星海图等产业方,以及BV百度风投、英诺天使基金、水木清华校友种子基金、东方嘉富等市场化基金支持。
©本文为原创内容
未经授权,禁止转载
热门跟贴