9月2日消息,近日,大晓机器人联合香港中文大学多媒体实验室、南洋理工大学等机构,开源面向第一视角视频的3D双手形状重建模型ACE-Ego-Hand,目前已产出约5000小时训练数据。

据了解,ACE-Ego-Hand可从第一视角视频中提取连续的双手三维操作轨迹,将抓取、装配及双手协同等人类操作过程转化为机器人可学习的数据。该模型将视频扩散模型作为几何编码器,通过一次前向传播直接输出双手姿态、形状、可见性及3D空间位置,减少传统多步去噪和逐帧检测带来的推理延迟及误差累积。

在手部遮挡或暂时离开画面的情况下,ACE-Ego-Hand可利用整段视频前后帧信息恢复中间运动轨迹,并通过片段级形状先验保持手部身份和尺寸稳定。在ARCTIC和HOT3D离屏手部评测中,其综合误差较ViDiHand分别降低45.9%和61.1%。

评测数据显示,ACE-Ego-Hand在ARCTIC、HOT3D、HOI4D、H2O和OakInk2五个第一视角手部基准上取得领先,在论文报告的48项主要指标中赢得45项。其中,HOT3D上的MPJPE-p为12.888毫米,较ViDiHand降低约40%;H2O上的MPJPE-p为9.223毫米;OakInk2上的MPJPE-p为8.988毫米,较此前最佳结果降低约66%。在单张A100 GPU上,模型运行速度约为63.1 fps,为ViDiHand高精度配置的约33倍。

应用方面,ACE-Ego-Hand可将头戴式相机记录的人类操作视频转换为连续3D动作数据,并进一步映射到机器人灵巧手,用于机器人示教、动作重定向、模仿学习及具身大模型训练。(葛嘉淼)