新型AI 人系统帮助人形机器人无需训练即可掌握各种杂技动作
人工智能学家
长期以来,人形机器人的运动能力训练一直面临一个近乎悖论式的困境:教它走路,它便只会走路;教它翻跟头,它却往往无法自然衔接到下一个动作。研究人员最新公布的一套名为&;BeyondMimic&;的框架,试图从根本上打破这一僵局,让机器人真正学会像人类一样,在不同技能之间流畅切换、灵活组合。
这项研究表明,该框架能够让人形机器人执行包括侧手翻、旋踢、体育动作乃至各类高难度杂技在内的复杂动作,且无需为每一项任务单独进行训练。这一点,恰恰击中了当前人形机器人控制系统普遍存在的核心痛点。
两阶段学习架构:从模仿人类动作到自主组合技能
现有的人形机器人控制方法通常依赖高度定制化的奖励函数,针对每一种具体动作反复调参,或是为不同任务分别搭建独立的训练流程。这种做法不仅效率低下,往往还会导致机器人动作僵硬、缺乏自然感。
BeyondMimic采用了一套两阶段学习架构来克服这一局限。在第一阶段,研究团队利用强化学习训练机器人追踪种类繁多的人类动作数据,而关键之处在于,整个训练过程始采用统一的动作追踪公式、共享的奖励结构以及相同的超参数设置,而非针对每个动作单独调整。
研究团队使用了约2.5小时的多样化人类动作数据对系统进行训练。最终,系统成功学会了数百种技能,涵盖日常行走、跑步、单腿平衡、跳跃、舞蹈动作、武术风格动作、旋踢乃至侧手翻等高难度动作。
其中21个具有代表性的动作片段随后被部署到真实的物理人形机器人上进行测试,实验结果证明了这些动作能够可靠地从仿真环境迁移至真实硬件平台。这一从虚拟到现实的成功迁移,正是该研究颇具说服力的关键环节之一。
潜在扩散模型:让机器人&;即兴创作&;新动作
第二阶段则引入了一种潜在扩散模型,正是这一模型赋予了BeyondMimic真正意义上生成与组合动作的能力。系统并非简单地重复播放已学会的动作序列,而是学习了协调状态与动作轨迹背后所蕴含的整体分布规律。
具体而言,一个变分自编码器首先将各类动作压缩为更为平滑的潜在表征,随后一个扩散模型学习这些潜在表征随时间演化的方式。研究团队随后在推理阶段引入分类器引导机制,借此将扩散模型导向那些训练过程中从未出现过的新目标,这使得机器人能够在无需重新训练或微调底层策略的前提下,灵活调整已掌握的技能。
举例而言,该系统能够接收摇杆指令并即时生成相应的行走或跑步动作,也能够引导机器人朝目标点导航、绕开障碍物,或利用稀疏的关键帧信息生成两点之间完整流畅的过渡动作。在一次演示中,机器人成功实现了从行走平滑过渡到侧手翻,随后又自然回归行走状态的完整动作序列,还完成了四连续侧手翻与跑步动作相互穿插的复杂组合。
这一框架还具备同时兼顾多重目标的能力。研究团队通过将路径点追踪与避障成本函数相结合,使机器人能够在绕开障碍物的同时持续朝目标方向前进,同样的框架逻辑,也可以将摇杆操控指令与碰撞规避机制有机结合。
接近人类运动员水平的动态表现,与更自然的&;人味儿&;
物理机器人实测展现出的动态表现颇为惹人注目,其中包括空中侧手翻、旋踢以及腾空踢击等高难度动作。在完成一次空中侧手翻动作时,机器人达到了每秒31米的峰值加速度,骨盆角速度峰值高达每秒15.7弧度,这一数值已经接近人类专业运动员完成同类空中动作时的参考数据。
除了动作的高难度与动态性之外,研究团队还发现,经该系统生成的行走与跑步动作,在人类观察者眼中显得更为自然。在一项涵盖77名参与者的对比研究中,BeyondMimic生成的运动方式在70.8%的选择中被认为比机器人原生控制系统的动作更接近人类、更自然,原生控制系统的动作仅获得29.2%的偏好。
研究团队强调,这项技术真正的关键突破,并非某个单一的新组件本身,而在于将可扩展的动作追踪能力、潜在扩散模型与推理阶段的引导机制三者有机整合。通过将&;技能习得&;与&;任务指定&;两个环节彼此分离,BeyondMimic为人形机器人开辟出一条新的发展路径——机器人能够学习并积累一套庞大的人类动作技能库,并在面对全新情境时,无需针对具体任务重新训练,便能自主完成技能的灵活重组与应用。
这一研究思路某种程度上呼应了当下人形机器人产业发展的整体趋势——从追求单一动作的精准复制,转向追求更具泛化能力与适应性的通用运动智能。对于人形机器人未来真正走入家庭、工厂乃至更为复杂多变的现实场景而言,这种&;举一反三&;式的学习能力,或许比单纯完成某个高难度动作本身,更具长远意义。
热门跟贴