打开网易新闻 查看精彩图片

手部运动是人类操作意图最直接的表达,也是机器人理解“动作如何发生”的关键入口。但其同时也是最难自动提取的数据之一。因此,十年来,手部重建一直是业内难题。

公司情报专家《财经涂鸦》获悉,近日,大晓机器人联合新加坡南洋理工大学与上海交通大学发布 ACE-ViDiHand,提出以视频世界模型先验驱动手部姿态估计的新范式,成功攻克“手部重建”这一难题。

这是全球首次将生成式世界模型引入第一人称视角下的4D双手运动重建任务。ACE-ViDiHand基于1.3B参数的视频扩散模型Wan2.1-VACE构建,将技术路线从传统的“先检测、再裁剪、逐帧回归”,转变为“直接从视频世界模型的内部表征中读取手部运动”。

该技术的突破在于,其将真实世界中的人手操作视频,转化为可学习、可对齐、可扩展的4D运动数据,为模仿学习、策略训练和机器人数据飞轮提供稳定的数据入口。

大晓认为,大规模视频生成模型在学习合成连贯视频的过程中,必须隐式解决4D手部重建长期依赖外部模块的三大难题——跨帧时空一致性、从2D观测推断3D几何、对被遮挡内容的推理。

为此,ACE-ViDiHand首次将视频生成模型引入手部动捕——不是在传统管线上叠加更强的检测器,而是从生成模型学到的“世界运行规律”中,直接读取手、物体与场景交互的结构化表征。这标志着手部动捕从判别式识别,走向生成式世界模型驱动的理解与重建。

据悉,ACE-ViDiHand构建了一套两阶段框架——第一阶段通过“手部叠加渲染”任务适配视频扩散模型,先教模型“画手”;第二阶段,双分支解码器从DiT中间层读取特征,从其内部表征中“读手“。

业内认为,ACE-ViDiHand 的意义不止于一个更强的手部动捕算法,而在于打通了一条新路径:从海量第一人称视频中稳定恢复双手4D轨迹,将原本难以利用的人类视频转化为具身数据资产。

此次发布 ACE-ViDiHand,也意味着其在世界模型、具身数据采集和机器人学习基础设施上的布局进一步深化。当前,大晓团队正通过蒸馏与少步生成器压缩推理成本,并计划以自监督方式摆脱对MANO标注的依赖,进一步扩展到物体运动与全身交互重建。

在ARCTIC、HOT3D 和 HOI4D三大公开基准上,ACE-ViDiHand均取得领先结果:在ARCTIC和HOT3D上九项指标全部排名第一,在完全留出的HOI4D上也拿下九项中的八项第一。尤其在严重遮挡场景中,模型依然能够稳定维持双手状态——ARCTIC上手部召回率和F1均达到99.9%,帧级准确率达到99.7%,帧级错误率仅为最强基线的不到4%,与此同时,三个数据集上的轨迹抖动较此前最佳方法降低约4.0至4.8倍。重建精度同样显著提升,其中HOT3D上的PA-MPJPE-p较此前最佳结果降低43%。