本文讲智元

前两天,是第二届世界人形机器人运动会

智元用他们的量产型机器人,非常高效的完成了一系列打螺丝工作,然后拿了金牌榜和奖牌榜的双第一:18金、16银、12铜

打开网易新闻 查看精彩图片

顺着这件事儿,让我来聊聊机器人行业的一些辛秘

机器人的遥控器

你一定刷到过非常多机器人的丝滑小视频,比如端茶倒水、叠衣服、后空翻,反正怎么看都很炸裂、让人眩晕瘫坐

但你会发现,这些小视频永远只是固定机位,或者从特定的几个角度拍摄...为啥呢?因为在镜头之外通常占个人,拿着手柄或者其他动作捕设备来操纵,大概就像这样

打开网易新闻 查看精彩图片

机器人的动作,其实是人在远程操纵,机器只是在执行指令。这其实挺常见的,现在 AI 脑子还不是很够用,应付不了真实世界里的意外

但现在技术也是逐渐好起来了,于是今年运动会的各种场景,会要求机器人脱离人手,否则得分减半;而对于 400 米跑和 1500 米跑,则强制全自主,把镜头外的那个人拿掉

捏豆子大赛

今年的运动会,专门为灵巧手设立了专项比赛,智元拆分出去的灵巧手子公司临界点,用量产版 OmniHand 拿到了 8 块金牌中的 7 块,考题包括粉末称重、开瓶撬盖、拆箱拆包、积木搭建,还有一个听起来最刁钻、但实际上最难的...镊子夹豆

豆子这东西吧,又硬又滑,反正我不觉得自己能很轻松的用筷子夹起来

但话说回来,虽然我夹不了这么快,但我用手拿肯定没问题...这里的区别在哪呢?我能摸到,能感受到这个用力的程度,然后把它拿起来(相反,你脑补一下,即便是用手,如果带上手套是不是也不行了)

对此,OmniHand 做了套方案叫 DUET,将动作系统和触觉系统绑定在了一起,让灵巧手能以每秒几百次的频率,感知到指尖触碰到了什么、有多大的压力、有没有发生滑动等等,然后这些数据会反馈作用到动作里,让夹豆子这件事儿变得可行

打开网易新闻 查看精彩图片

场景竞赛

今年的机器人大赛场中,场景赛共有 12 项,对酒店、图书馆、应急处置等多元部署态任务对机器人全身协同、环境理解、长流程任务规划提出考核。在这里,智元斩获了 12 块金牌中的 6 块,居金牌榜的首位

智元这边的参赛代表是精灵 G2,在参加运动会前,早已在龙旗工厂,上汽工厂等大规模落地部署,工作经验非常丰富,不依赖赛场特化改装,便可完整复现现实世界的工作流程。而在这些的背后是作业智能、运动智能、交互智能这三位一体的结构

智元内部把这套东西叫「三智一体」:机器人得四肢发达、头脑灵活、能说会道、干活利索,具体来说,是下面的几套东西

  • GO2:Genie Operator 2.0,具身基座大模型,用来看懂桌上那个是杯子还是垃圾

  • GE2:Genie Envisioner 2.0,世界模型,负责常识,比如知道杯子碰倒了水会洒出来,来能预测接下来会发生什么

  • ViLLA:视觉语言隐式动作架构,把看到的东西翻译成具体该怎么动

这三套模型负责着机器人的看懂、想明白、干出来,这套东西跑通之后还有个额外的红利,叫跨本体泛化,也就是在可以在上一个场景中学会了抓杯子,而到了工厂里面就知道怎么抓零件

虚拟实训

在舞蹈、武术、乒乓等表演项目中,智元也拿到了 5 块金牌

这里给大家讲一个吹牛逼小知识:机器人打太极拳,是一件很考验功底的事情,它慢

机器人在跑步的时候,步子迈得极快。哪怕有一脚踩得不稳,身体失去平衡了,也没太大关系,因为很快就会有下一个动作,身体就被惯性带着糊弄过去了,还很有观赏性

但打太极就不太好糊弄了,它要求机器人以校为的站姿呈现,过程中身体缓缓下沉,重心一点一点地从左边移到右边,过程中并没有惯性能借,如果要保持观赏效果,很容易让平衡误差放大,然后摔给你看

为了让机器人能够更好、更快的训练,并实现全身姿态实时调控腾空、运动过程中全域实时校准躯干与四肢协同角度,动态调节重心等难点,智元搭建了Sim2Real 仿真系统,先在虚拟平台里训练好,再做能力迁移

但还不算完,电脑里的模型再逼真,与现实也是有差距的,比如关节摩擦力、地面软硬、电机响应延迟等等,真机一动就可能因为这些误差摔倒。于是智元采用了参数辨识的办法,先拿着真机在现实里做几组动作,收集真实数据。再拿这些数据反过来校准电脑里的虚拟模型,把假的往真的方向靠,逼着物理引擎接受现实的瑕疵

具身智能,要先具身再智能

打开网易新闻 查看精彩图片

机器人的田径场

量产版本的灵犀 X2 在 100 米障碍赛拿了金牌,400 米障碍又拿了银铜

而在取得这些成就的背后,是智元给机器人装上了眼睛

你没看错...是给机器人装上了眼睛

与大多数人想象中不同的是,市面上绝大多数机器人跑步,其实是闭着眼跑的,主要靠的是关节本体的感知,比如每个关节弯了多少度、脚底力量的反馈啥的,就一如你闭着眼睛在平地上走

这种方法在平地上跑步没问题,就如同咱们人也能闭着眼睛走。但遇到障碍赛就不行了,这里就必须用视觉或者类似的方案去判断台阶、跨栏以及场地信息,通过临场发挥来行动

打开网易新闻 查看精彩图片

在这一部分中,灵犀 X2 靠的是自研的 AGILE 通用小脑引擎,其全称是 AgiBot Generative Intelligent Locomotion Engine,在不规则的场地下,根据眼睛看到的画面,进行自主与半自主的决策,并对姿态进行调整

闭眼跑靠记忆,睁眼跑靠判断。这是人形机器人走出实验室、走进车间的一步

最后

这次参赛的智元机器人,也都是工厂实际在用的量产机

比如今年6月,精灵G2在龙旗科技江西南昌工厂完成了为期6天的平板电脑质检工段作业直播,6天内累计完成17625次作业,任务成功率达99.99%。

机器人行业,过去更多是开发态和创作态,今年会有一个大的变化,就是会进入部署态

打开网易新闻 查看精彩图片