打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

过去两年,具身智能行业最让人头疼的问题,是机器学习的数据。

一个机器人要掌握抓取、搬运、装配这些技能,背后往往需要工程师团队用遥操作设备反复示范,或者在仿真环境里生成海量轨迹。一个流畅的拿取、移动、放置动作,可能就是几个月的采集和训练。更麻烦的是,场景一变、零件一换,很多数据就直接作废了。

大家都希望找一条更低成本的路。人类看一遍视频就能学会新动作机器人为什么不行?李飞飞团队、Figure AI都在探索这个方向,特斯拉也宣布要让Optimus借助员工操作视频开展训练。但这条路有一个天然难题,那就是人和机器人的身体结构完全不同。五根手指完成的精细操作,两指夹爪根本照搬不了。

针对这个问题,奥克兰大学LISMS实验室与西安交通大学联合提出了一个名为 Video2Knowledge的框架。它的核心思路不是模仿人的动作轨迹,而是让机器理解“视频里发生了什么任务”,然后自己规划怎么干。整个框架的输入没有深度传感器,没有多视角相机阵列,也不需要物体CAD图纸,就只有一段用手机拍摄的普通单目RGB视频。

打开网易新闻 查看精彩图片

但单目视频有个致命缺陷,没有深度信息。同一物体在不同视角下,位置会“漂移”,旋转角度也容易“跳变”。把这种有偏差的数据喂给机器人,动作必然不准。

为了解决这个问题,系统首先从视频里提取手部和物体的运动信息。手部姿态用的是WiLoR模型,从单张RGB图恢复密集3D手部网格。左手跟踪准确率在三个视角下分别达到95.1%、89.2%和96.0%,右手是87.5%、95.6%和97.5%。物体追踪采用OnePoseViaGen这类方法,不需要CAD模型,直接从视频里重建物体3D形状,再追踪每一帧的6D位姿。

而特征匹配得到的位姿常常会出现不合理的旋转跳跃,团队为此设计了一个“物理感知校正模块”。一共分四阶段修正,先剔除位置异常值,再检测并修正90°和180°级别的旋转跳跃,最后通过投影一致性验证,确保修正后的位姿和画面吻合。

校正效果很明显。左侧正面视角下,操作物体位姿准确率从52.5%提升到59.0%,目标物体从84.5%提升到89.0%。在特定视角和任务中,操作物体的形状准确率甚至能从18.2%直接拉到95.5%。

打开网易新闻 查看精彩图片

不过论文也指出,在快速运动或严重遮挡场景下,校正模块有时反而会放大误差,这也是团队下一步要解决的问题。对比卡尔曼滤波、移动平均滤波等传统平滑方法,那些滤波器全都没能提升准确率,唯独这个校正模块在所有指标上持平或超过原始输入。消融实验显示,去掉单轴旋转检测后,操作物体的形状和位姿准确率各掉约18%;去掉投影验证后,旋转准确率直接降到最低。

有了稳定的手和物体轨迹,系统开始分析语义。通过手物距离、物体运动状态、抓握姿态等线索,把连续视频切分成有意义的动作片段,如:接近、抓取、移动、持握、放置,同时记录物体最终的位置和朝向变化。

打开网易新闻 查看精彩图片

在HA-ViD和Assembly101两个公开装配数据集上,提取的任务知识与真实数据参考对比,任务序列一致性达到79.1%,最终几何状态一致性达到72.5%。

最后从动作片段里提取关键帧作为路径点,生成夹爪开合指令,导出成JSON格式直接喂给机器人。

这套流程在仿真环境里跑通后,团队又把它拿到了真实产线上验证。操作员演示如何把检测探头放到工件上,Omron TM5-900协作机器人看视频学。在完成锚定帧选取、手眼坐标映射和抓取位姿标定等一次性人工配置后,系统约18分钟就能转换成机器人动作序列,而传统手动编程约35分钟,示教编程约25分钟。

打开网易新闻 查看精彩图片

如果工件或探头位置变了,重新拍一段视频,系统会自动重新计算路径,并不需要重新编程。通过套环和多路径点转移两个全新任务,系统同样能成功提取任务结构并生成可执行序列。

当然,它也有短板。小物体、严重遮挡、快速运动下,位姿估计质量明显下降,校正模块有时反而放大误差。团队表示下一步将用多尺度检测和时序感知架构提升鲁棒性,并探索组合式任务表征,让学到的操作基元能重组为新任务,实现更长程的自主规划。

总的来说,从遥操作到仿真训练,从大模型微调到视频学习,机器人技能获取的方式正在被一步步拓宽。Video2Knowledge提供的正是一条低门槛路径,一段普通视频,让机器人看懂任务,然后试着执行。当车间师傅用手机拍一段手势,机器人就能学着干时,机器学习,或许便不再“大动干戈”了。