这项由蚂蚁数字科技、蚂蚁集团联合浙江大学、香港大学、香港科技大学(广州)、新加坡国立大学、北京智源人工智能研究院、中国科学院大学、香港科技大学及西安交通大学共同完成的研究,于2026年7月以arXiv预印本形式公开发布,论文编号为arXiv:2607.14183v2,研究成果以开源形式向全球社区免费开放。
**一、"教机器人动手",为什么那么难?**
教会一个机器人如何拿起一个水杯、擦干桌子或者叠一件衬衫,听起来简单,却是当今人工智能领域最棘手的挑战之一。语言模型可以通过海量网络文字"自学成才",但机器人学习动作技能,需要的是真实的、有肢体动作细节的操作示范数据。这类数据不仅获取门槛高,而且整理起来极为麻烦。
过去,研究者要么让专业人员穿戴昂贵的VR头盔或动作捕捉设备录制示范视频,要么直接遥控机器人完成任务来积累数据。前者成本高且场景受限,后者效率低且难以扩展到日常生活的多样性。正因如此,机器人学习领域长期面临一个痛点:数据量太少、场景太单一、格式五花八门、难以直接用于训练模型。
蚂蚁数字科技领衔的研究团队正是为了填补这个空白而推出了Open-AoE这套系统。这个项目的核心理念很直白:每个人口袋里都有一部智能手机,如果能把普通人日常做家务、做饭、做手工时的第一视角视频收集起来,再配上精准的手部动作标注、相机运动轨迹和动作描述,那不就是机器人学习的天然"教材库"吗?
**二、手机摄像头变成"机器人教练":Open-AoE是什么?**
Open-AoE是一套完整的"数据基础设施",而不仅仅是一个视频数据集。打个比方,如果机器人学习是一道复杂的菜肴,那么以往的数据集只是给你一堆未经处理的食材,而Open-AoE则是从选材、洗菜、切配、烹饪到装盘摆台的完整食谱加厨具套装。
它的第一版本包含约2000小时的第一视角人类操作视频,这些视频由超过500名志愿者贡献,使用了400多种型号的智能手机,覆盖400多种不同场景,涉及超过8000种操作任务。视频本身是基础,但真正让这套数据集与众不同的,是附带的四类结构化标注信息:自然语言文字描述、基于MANO模型的三维手部姿态、相机运动轨迹,以及被精确定位到时间轴上的"原子动作"片段——所谓原子动作,就是把一段完整操作切分成最小的、有独立语义的动作单元,比如"抓住瓶盖"、"顺时针旋转"、"向下按压"。
除了数据本身,Open-AoE还开源了两套工具链:一套是数据生产流水线,负责把原始手机录像变成规范化的训练样本;另一套是下游工具链,帮助研究者把这些数据转化为可以用于训练各种机器人模型的格式。整套系统的源代码、文档和使用示例全部公开在GitHub上,并同步在Hugging Face和ModelScope平台上提供数据下载。
**三、数据从手机到"教材":四道严苛的处理关卡**
一段普通的手机录像距离能够训练机器人的高质量数据,中间隔着一条复杂的加工链。Open-AoE的数据处理流水线分为四个阶段,每一阶段都像一道精密的过滤网。
第一阶段发生在手机端,用轻量级的视觉模型实时监控录像质量。系统会自动检测画面中是否有双手出现,一旦手入镜就开始录制,手消失就停止,避免录下大量无效内容。与此同时,系统还会监测佩戴姿势是否稳定、录制角度是否符合第一视角标准,并通过语音提示告知使用者进行调整。在光线昏暗时,系统会自动开启补光和曝光调节;遇到设备过热或存储不足时,会主动暂停录制。更关键的是,在上传之前,系统会对视频中可能出现的人脸和其他隐私信息进行本地模糊处理,从源头保护采集者的隐私。这种"端侧轻量化"的设计让上传到云端的数据从一开始就是经过初步筛选的有效片段,大幅节省存储和带宽成本。
第二阶段是云端的离线质量检查与场景标注。这里又分三个子步骤。首先,一批基于图像分析算法的规则型检测器并行运行,快速剔除画面黑屏、曝光严重失当、文件损坏、时长太短或解码失败的视频;接着检查录像中是否确实有双手可见,排除固定机位拍摄或第三人称视角的片段,以及抖动严重的片段;然后对视频中残留的人脸、敏感信息进行再次检测和打码,并把采集者的个人身份信息替换为匿名标识符,这个映射关系被完整保存,必要时可以授权逆向追溯。
通过图像级别检查的视频会被切分成若干语义独立的片段,每个片段的帧率也会被统一标准化。之后,这些片段进入大模型检测环节。研究团队使用了Qwen3.7-Plus这个视觉语言模型,从语义层面再次核查片段是否符合采集规范、操作动作是否完整且有目的性,并为每个片段建立一套四层标签树,分别对应领域、场景、任务和涉及的物体。这种分层标签体系让研究者可以按照"厨房场景下的食材处理任务,涉及菜刀和蔬菜"这样的粒度快速检索数据。
第三阶段是重建与标注,也是技术含量最高的环节。相机轨迹的恢复使用了DROID-W这个SLAM(同步定位与地图构建)算法,该算法的鲁棒核函数被专门针对手持和穿戴拍摄场景重新调优,能够在剧烈抖动和身体运动干扰下保持六自由度轨迹的稳定性。手部三维重建则从一个专为AoE大规模第一视角数据训练的双手检测器开始,这个检测器提供每帧的手部边界框,并在帧间建立关联关系,还能补全短暂遮挡时缺失的检测结果;在此基础上,HaWoR算法恢复出符合MANO参数化人手模型的三维网格,通过SLAM结果对齐到真实尺度,并转换到世界坐标系下,滑动窗口优化保证了时间上的连贯性。最后,对HaWoR重建结果和DROID-W提供的动态物体掩码做联合束调整(bundle adjustment),在统一的世界坐标系下同时优化手部网格和相机轨迹,彻底消除分段重建带来的尺度漂移和坐标不匹配问题。从恢复的手部网格中提取出21个关节点的骨架坐标,同时将每段视频切分成若干语义连贯的原子动作片段,每个片段附上英文描述标签,并由人工审核纠正模型产生的幻觉错误。
第四阶段是三重质量门控与交付。完整性门检查手部重建有效帧的比例是否足够高,确保姿态标注的可靠性;正确性门检查逆运动学(IK,一种把手部姿态映射到机器人关节角度的算法)失败率是否在低水平,确保数据能被下游机器人系统实际使用;一致性门检查相机轨迹是否平滑连续、相邻帧之间没有突兀跳跃。通过三重门控的数据,还有一批随机采样的样本要经过人工抽检,确认标注准确性,并剔除严重遮挡或极端光线等边缘情况,最终从完整数据池中精选出约2000小时作为开源发布版本。
**四、数据有多丰富?一次100小时的随机抽样告诉你答案**
为了客观评估数据集的多样性,研究团队从2000小时中随机抽取了100小时进行详细统计分析。
从语义内容看,这100小时中包含32407条不同的自然语言动作描述,涵盖175种不同的动作动词和8030种不同的物体名称,场景标签多达135种。厨房场景占比最高,达到24.8%;桌面或室内场景以23.3%紧随其后;办公室或书桌场景占17.8%;卧室占9.1%;其余部分则分布在客厅、工作室、浴室、户外、洗衣房以及零售服务场景中。动作类型从切菜、缝纫、折叠衣物这类常见家务,到处理葵花籽、穿针引线、整理硬币这类精细操作,构成了一个广阔的操作动作库。
从贡献者分布看,这100小时数据呈现出明显的长尾分布——大多数贡献者只提交了少量视频,贡献最多的10位采集者合计也只占总时长的13.7%,中位数贡献量仅为每人2.6分钟。这种分布结构意味着数据集不会被少数人的操作习惯所主导,从而保留了更广泛的手部动作风格、手部外观和拍摄环境变化。
从设备多样性看,仅这100小时样本就涵盖了400多个智能手机型号,品牌覆盖vivo、华为、小米、OPPO、荣耀、真我等主流国内品牌。设备型号本质上是相机系统的代理变量,不同型号意味着不同的镜头焦距、图像传感器、图像信号处理器、分辨率模式、曝光算法和拍摄固件。水平视场角(FOV)的分布呈现出三个峰值,分别集中在65°至75°和90°至95°附近的两个区间,三个最大的5度区间分别占比30.7%、30.2%和31.7%。这种多峰分布反映了不同相机和镜头配置的普遍存在,而非单一光学系统的重复。当训练视觉策略的模型需要在各种未见过的相机、部署装置和机器人视角下正常工作时,这种自然存在的传感器域随机性就构成了天然的泛化训练条件。
**五、工具链:从原始数据到可用模型的"全套厨具"**
收集到数据只是第一步,如何把这些数据变成机器人能学习的形式,才是真正考验工程能力的地方。Open-AoE的工具链由三个功能模块组成,彼此衔接,形成一条从数据检视到模型训练的完整通路。
第一个模块是可视化工具AoE-Visualization。它以第一视角原始视频为画布,在上面叠加MANO三维手部网格、21个关节点的骨架线、未来一段时间内的手腕运动轨迹,以及当前时间段对应的原子动作文字标签,同时在旁边展示世界坐标系下的三维俯视图和时间轴。研究者可以用这个工具直观地发现重投影误差、手部缺失帧段、SLAM漂移和语义边界标错等问题,而不是等这些问题被模型当成真实的运动规律吸收进去。
第二个模块是重建与迁移工具AoE-Reconstruct-Retarget,负责把第一视角视频变成机器人可执行的动作。它包含三条并行的处理路线。第一条是四维手部与物体重建,使用EgoInfinity和Do-as-I-Do两套算法,将单目视频提升为随时间变化的手部几何形状、物体六自由度姿态和交互资产;AoE数据中的相机内参和度量尺度相机轨迹在这里发挥了关键作用,帮助算法把观察者自身运动和场景中物体的运动分离开来。第二条是跨形态运动迁移,核心问题是"人类做的动作,怎么让机器人也做出来"。工具链集成了多个机器人平台的迁移后端:Phantom方案把相机局部坐标系下的手腕和手指运动,通过逆运动学加指尖重定向算法映射到宇树G1人形机器人配Dex3或Inspire灵巧手的关节轨迹;Retarget Galbot方案把双手掌心目标位置转换为Galbot/Galaxea机器人的末端执行器轨迹和夹爪控制指令;Retarget Lab还整合了EgoInfinity/G1、Do-as-I-Do/Sharpa和SPIDER/XHand等更多运动学和物理感知迁移方案。第三条是机器人化视频生成,先用SAM2算法分割出人手和手臂的掩码,再用E2FGVI或ProPainter算法把人手从画面中抠掉并填充背景,最后把MuJoCo物理模拟引擎渲染的机器人动作合成叠加到原始场景中。生成的视频保留了真实场景的光线、被操作物体和任务进度,只是把操作者的外观换成了机器人,为人到机器人的视觉域迁移和机器人与场景一致性学习提供了对齐的配对数据。
第三个模块是训练就绪工具AoE-Training-Ready,负责把同步的视频、手部姿态、相机运动和语言标注,转化为不同模型架构所需要的特定动作表示格式。这个模块的核心设计理念是:没有一种动作向量适合所有下游任务,所以工具链保留了信号的物理含义,根据下游问题选择合适的表示层级。
具体来说,工具链暴露了五种不同密度的动作接口。最稠密的是110维的MANO状态/动作向量,由左右手各一个55维向量拼接而成,每个55维向量包含有效标志位、手腕三维位移、手腕轴角旋转、速度和45维MANO手形参数;坐标系是当前帧的OpenCV相机坐标系,单位分别是米、弧度和米/秒,需要注意的是这个速度包含了手部运动和相机自身运动两部分。次稠密的是48维腕部-指尖向量,包含手腕位置和旋转6D表示加上五个指尖的三维位置,坐标系是SLAM世界坐标系,用于H-RDT适配器。62维Sharpa格式包含左右手末端执行器位姿加Sharpa机器人关节角,用于GR00T N1.7适配器。20维GR00T夹爪格式则是低自由度版本的GR00T适配器。最后是22维状态/20至26维本体动作格式,用于SmolVLA、iVideoGPT、LAOM和GenieRedux等模型的适配器。
对于视觉语言动作(VLA)策略模型,工具链为VITRA、H-RDT、GR00T N1.7、SmolVLA以及基于LeRobot框架的π0.5、ACT和扩散策略等多种架构提供了现成的训练接口,让研究者无需自行编写数据加载和格式转换代码。对于世界动作模型(WAM,即学习"当前动作会导致什么未来状态"的模型),DreamZero、LingBot-VA、Ctrl-World和iVideoGPT等框架可以利用AoE提供的稠密手部状态或紧凑的手部加相机动作来学习动作预测和视觉动态。由于AoE同步了手部轨迹和相机轨迹,模型可以把这两个因果来源作为独立的条件变量来处理,为可控视觉预测提供了精准的监督信号。对于世界模型(学习场景交互动态的生成模型),GenieRedux、AdaWorld、LAOM和DreamDojo等框架可以从无标签视频出发学习潜在动作变量,再逐渐用MANO手部运动和动作片段标注来监督这些潜在变量应该表示什么,最终实现用显式手部运动控制未来视频生成——这条路线把无监督世界建模和有具身意义的控制信号自然地连接了起来。
**六、与其他数据集的比较:六个维度的横向测试**
为了客观评估Open-AoE与现有数据集相比的差异化价值,研究团队选取了OpenEgo、EgoDex和EgoXtreme三个代表性数据集进行多维度比较,每个数据集各取约100小时(EgoXtreme规模较小,使用其全部可用数据)。
视觉多样性的测量借助了CLIP图像嵌入(一种把图像压缩成高维向量的预训练视觉特征)。研究者进行了3000次平衡随机采样实验,每次从四个数据集中各取2000张图像嵌入,计算六个不同角度的多样性指标。有效秩衡量特征分布在多少个活跃方向上展开,类似于一个发光体究竟照亮了多少个不同方向;参与率衡量特征方差是否集中在少数方向还是均匀分布;有意义覆盖率统计在共享特征空间中有多少个区域被稳定占据;归一化聚类熵和有效聚类数衡量特征在这些区域的分布是否均衡;k近邻域混合度测量某数据集的样本与其他数据集的样本在特征空间中的局部混合程度,越高说明视觉风格与其他数据集的重叠越多,视觉范围越广。在全部六项指标上,Open-AoE均排名第一:有效秩97.4,参与率40.5,有意义覆盖率19.9,归一化聚类熵0.712,有效聚类数16.3,k近邻域混合度0.078。尤其是有效秩和k近邻域混合度两项优势最为显著,说明Open-AoE不仅特征分布在更多方向上展开,而且与其他视觉域的局部连接更强。
语义广度和时间覆盖方面,Open-AoE拥有32407种不同的自然语言动作描述,相比之下OpenEgo有26864个原生标签,而EgoDex只有111个类别标签。时间覆盖率方面,Open-AoE的标注覆盖了被评估时间轴的99.99%,而OpenEgo的时间覆盖率只有50.1%;标注密度为每分钟13.97个片段,平均片段时长9.64秒,EgoDex每分钟片段密度略高(14.31个),但词汇量远小于Open-AoE。
图像与标注一致性的评估使用了Idefics2这个视觉语言评估模型,对每段视频随机抽帧,请模型判断该帧画面内容与标注描述的吻合程度,打分范围1到5分。Open-AoE的序列宏观平均分达到4.583,95%置信区间为[4.557, 4.608],其中85.4%的序列平均分在4分以上;OpenEgo得分3.029,EgoDex得分2.916,EgoXtreme仅得2.015。这个结果说明Open-AoE的标注不仅广,而且准——绝大多数标注与视频内容高度吻合。
训练样本产出率和多模态完整性的评估使用了一个实用导向的测试:以2秒历史窗口、2秒未来窗口、2秒步长的方式在每段视频上滑动提取训练样本,统计每小时能产出多少有效样本。理论上限是每小时1800个样本(3600秒÷2秒步长)。Open-AoE的实际产出率为每小时1760个,达到理论上限的97.8%,说明其序列的时间连续性非常好,序列边界造成的损失极小。OpenEgo同样达到了98.9%的高产出率,但EgoDex只有68.1%,说明其视频片段较短,边界损耗较大。手部信号可用性方面,Open-AoE有98.93%的帧包含至少一只手的有效信号,98.02%的帧同时包含双手的有效信号,远高于OpenEgo(单手有效率66.2%,双手有效率55.6%)。监督模态完整性的检查涵盖动作标注、边界框、标注置信度、手部姿态和相机姿态五项,Open-AoE是唯一一个五项全部具备且覆盖率接近100%的数据集。边界框质量同样优异:100%有效框,98.39%完全位于图像边界内,平均置信度0.947,第10百分位置信度0.950。
**七、开放生态的愿景:数据不再是具身智能的瓶颈**
说到底,Open-AoE想解决的问题不是"数据够不够多",而是"数据能不能用"。
这套系统把数据采集、处理、重建和训练打通成一个可持续运转的闭环,从手机端的轻量实时质控,到云端的多阶段清洗标注,再到面向模型的格式转换接口,每一个环节都是开放的、可复用的。一个想研究手部动作生成的学者、一个想训练机器人策略的工程师、一个想研究视觉世界模型的研究生,都可以从这套基础设施的不同位置切入,拿走自己需要的那部分,而无需从头搭建私有的数据处理栈。
研究团队也明确表示,Open-AoE的目标是成为一个由数据贡献者、高校、科研机构、机器人开发者和模型团队共同演进的开放生态,而非一个静态的数据包。社区可以不断提交新的真实场景和任务、新的重建与迁移方法、新的训练适配器和评估结果,让数据、工具和模型在开放循环中一起成长。
这当然不是终点。数据集自身也有局限——视频来源于普通手机而非精密传感器,三维重建的精度不可能与运动捕捉系统相媲美,镜头模糊、遮挡和极端光线环境仍会影响部分样本质量;相机域多样性对模型泛化能力的具体贡献,也还需要通过严格的消融实验来验证。但它所做的事情,是把"用普通手机拍的视频训练机器人"这条路走通了一大段,让从人类日常行为到机器人可执行动作的知识迁移,有了一套开放的、可扩展的、可复用的基础设施。对于正在探索具身智能的研究者来说,这套基础设施的价值,可能远大于数字本身。有兴趣深入了解的读者可以通过论文编号arXiv:2607.14183查阅完整原文。
Q&A
Q1:Open-AoE数据集和其他第一视角数据集有什么区别?
A:Open-AoE最大的区别在于"全套配件"。现有数据集大多只提供视频本身,而Open-AoE同时提供了三维手部姿态、相机运动轨迹、精确到秒级的动作分段和自然语言描述,并且配备了从数据采集到模型训练的完整开源工具链。在对比测试中,Open-AoE在视觉多样性、标注覆盖率、图像与标注一致性以及训练样本产出率等六项指标上均排名第一,是目前唯一一个五类监督信号(动作文字、边界框、置信度、手部姿态、相机姿态)全部具备且覆盖率接近100%的公开数据集。
Q2:Open-AoE的数据是怎么保护参与者隐私的?
A:隐私保护在采集流程的最源头就开始了。手机端的应用会在上传前对视频中的人脸和敏感信息进行本地模糊处理。数据上传到云端后,服务器会再次检测并打码残留的面部和隐私区域,同时把采集者的姓名、联系方式等个人身份信息替换为匿名标识符,目录名和元数据字段也一并重写。最终公开发布的数据中不包含账号信息、支付信息或其他个人元数据,且所有参与者在参与前均已知情同意并确认上传。
Q3:普通人可以给Open-AoE贡献数据吗,怎么操作?
A:可以。Open-AoE专门开发了一款名为AoE Capture的手机应用,安卓和iOS版本均可下载。安装后,使用者佩戴手机(通常固定在前额或胸前),进行日常操作时应用会自动检测手部入镜并开始录制,手消失后自动停止,同时实时语音提示调整姿势和角度。录制完成后,使用者在本地审核视频并确认上传。系统会自动完成隐私处理和格式检查,符合标准的片段才会进入数据库。这种设计让贡献数据的门槛降到只需要一部普通智能手机。
热门跟贴