让人形机器人像人类一样灵活完成各类日常任务,是具身智能领域的核心目标。但长期以来,机器人的技能学习高度依赖真实动作捕捉数据,不仅采集设备成本高昂、部署门槛高,还很难覆盖同一任务的多样化动作风格,直接限制了机器人动作的自然度与泛化能力
近日,中国台湾成功大学(NCKU)研究团队在预印本平台arXiv发表最新研究成果,彻底跳出了“真实数据采集”的传统框架。该团队借助生成式AI大模型的能力,仅通过文本提示就能生成逼真、多样的人体运动视频,全程无需任何真人采集的真实数据,即可完成人形机器人的技能训练,为低成本、规模化的具身智能训练提供了全新范式。
该研究论文题为《Learning Diverse Humanoid Tasks via Synthetic Video Scenarios without Real World Data》,由Yun-Hao Tsai、Cong-Thanh Vu与Yen-Chen Liu共同完成。
一、行业痛点:模仿学习的两大核心瓶颈
在具身智能与人形机器人领域,数据驱动的模仿学习是赋予机器人类人动作能力的核心技术路径,DeepMimic、AMP等经典方法均基于这一逻辑。但落地过程中,行业始终面临两大难以突破的瓶颈:第一,高质量动捕数据极度稀缺。专业动作捕捉系统成本高、场景受限,可获取的数据集规模有限,导致训练出的动作泛化能力弱,难以适配复杂多变的真实任务;第二,动作多样性严重不足。现实中同一个任务可以有多种完成方式,不同人的动作习惯、姿态细节差异显著,但单一的示范数据无法覆盖这种多样性,机器人输出的动作僵硬、脱离真实人类行为逻辑。
二、核心方案:提示词驱动,AI生成视频替代真实动捕
为从根源上破解数据获取难题,研究团队以视频生成大模型为核心,提出了“文本提示驱动的机器人运动生成”策略,实现了跨模态的数据生产闭环。
具体而言,团队通过精心设计的文本指令约束生成过程,明确要求画面保持相机静止、人物全身入镜、动作符合人体力学规律等,引导Google Veo 3等生成式AI模型输出高度标准化、物理逻辑合理的人体动作视频。这种方式既解决了传统数据采集成本高的问题,又能无限生成多样化的动作变体,打破了“数据规模与多样性不可兼得”的行业困境。
三、完整技术链路:从文本到机器人动作的全流程落地
从文本提示到机器人稳定执行任务,研究团队搭建了一套完整的自动化技术链路,核心分为四个环节:
合成视频生成:输入任务描述文本,由视频生成大模型输出对应动作的人体运动视频,同一任务可生成多种不同风格的动作变体。实验中团队测试了50种日常任务提示词,每个任务均可生成10种不同的动作版本,数据生产效率远超传统采集方式。
姿态提取与优化:通过SMPL-X高保真人体参数模型,从生成视频中提取人体骨骼运动数据,同时通过算法修正脚部滑动等不符合物理规律的伪影,保障动作数据的合理性。
运动重定向适配:将人类骨骼运动数据映射到人形机器人的关节结构上,调整关节自由度、力矩范围,生成适配机器人硬件的参考运动轨迹。
多段动作拼接:针对长序列复杂任务,团队设计了自动化动作拼接方案,通过根节点坐标对齐、关节姿态平滑过渡,将多段独立动作无缝衔接,让机器人可以连贯完成复合任务,形成类似人类“肌肉记忆”的连续动作逻辑。
四、实验验证:Unitree G1仿真训练效果达标
研究团队在NVIDIA Isaac Lab仿真环境中,以宇树G1人形机器人为载体完成了实战验证,通过4096个并行智能体开展强化学习训练,让机器人追踪生成的参考轨迹输出关节力矩,完成动作学习。
实验测试了躺卧起身、拳击、抓取放置等多类动态任务,结果显示:
即便在抓取放置任务中为机器人附加0.5kg负载,机器人下半身仍能保持姿态稳定,上半身可自动调整力矩补偿负载重量,动作稳定性表现优异;
关节位置追踪的平均绝对误差(MAE)仅在0.04-0.07米区间,与真实动捕数据训练的效果差距极小,充分验证了合成视频数据的高精度与物理可行性。
五、研究价值:开启低成本规模化训练新可能
这项研究的核心意义,在于用“生成式AI+强化学习”的组合,彻底摆脱了人形机器人训练对昂贵动捕设备与真人采集数据的依赖。它不仅证明了零真实数据的合成视频,完全可以为仿真环境中的机器人提供高质量、多样化的运动指导,更降低了具身智能技能训练的门槛与成本。
随着技术的持续迭代,这套方案有望支撑下一代通用人形机器人的大规模、多品类技能训练,为具身智能的快速落地打开全新的想象空间。
热门跟贴