研究员|邱慧 卢杨

宇树科技上市次日,创始人王兴兴亮相2026世界机器人大会(WRC)。

他指出,用AI技术大幅提升机器人的开发效率是值得做的一件事情。

他提到,目前全世界范围内,制约机器人真正走进生活、走进家庭的最大瓶颈就是,具身智能的泛化能力还不太够。“在一个固定场景上,做足够的采集训练,机器人能做到接近100%的成功率。但是如果操作的物品或者环境稍微换一下,成功率就出现下降。”

王兴兴坦言,机器人在任务执行中“最后一厘米”的偏差机会导致其任务成功率出现暴跌,“这是非常严重的一件事”。

他判断,未来产业的临界爆发点将是,用户将机器人带到任意陌生环境,仅通过语言或文字指令就能完成80%左右的任务,“这个节点有望快的话2-3年、慢的话5-10年”。

打开网易新闻 查看精彩图片

下面是演讲实录(经编辑):

大家好,非常荣幸在此做分享。我们公司的话,2016年8月份成立,到现在将近10年时间。

我们公司最早是做四足机器人,最近几年做人形机。最近几年做的比较成功的一款机器人的话,就是我们24年推出这款G1这款机器。这款机器人以推出以后,就基本上成为了一个全球的一个标杆性的一个产品。

所以,目前大家在看到的我们公司的绝大部分的机器人产品,或者全球大家在用的机器人产品,基本上都是跟他同一款产品,或者跟他长得都非常非常类似的一款产品啊,这个事情。

然后另外的话,像今年年初比较代表性的话,就是我们的“武bot”。

我们公司在过去年一直在推动机器人真正的去走进生活、去工厂干活这件事。像2024年,我们就跟汽车工厂合作,去做汽车工厂线的一些落地应用,包括也在我们自己的工厂部署,机器人做一些简单测试和落地应用,

我们公司里面绝大部分的AI的团队都在做机器人,真正的在家庭或者在工厂里干活。这部分事情,为什么我们现在没有大规模推广呢?最主要原因就是目前整个效率和它的泛用性能力还是不够提高。

简单来说,就是虽然目前我们机器人能做一些简单的装配了,但它的效率跟人比起来还是比人还是更低一些。另外,每次有一些新的任务过来的时候,要重新进行训练,再到效率相对更低一点。所以我们还是希望把技术做到更加泛化、能力更好的情况,再进行大规模推广。这是目前全球共同的最大瓶颈。

大家也知道,目前的机器人都是AI驱动的。AI的话,目前基本都数据驱动,有多少数据,尤其有多少高质量的数据,就有多少AI。所以我们也在自己采集,或者和第三方公司合作采集更多的数据给大家用,也给我们自己用。

数据的驱动,还是非常重要的事情。目前,我个人感觉是真正的AI机器人训练数据,还是大量的海量真人数据或者互联网数据为主要的预训练数据,再加上部分真实数据,这是我觉得是刚需的两部分数据。如果从量的角度来说,还是真人的数据会更加多或更加重要一些。

真人的机器采集数据也非常重要,因为我们需要把机器人真正的跟物理世界进行做匹配。包括今年5月份,我们发布了就是在全球第一款量产级的那个载人机甲,这款机器人身高大概有3米多高,如果载人以后重量大概500千克左右。

某种意义上,大家可能会好奇这款机器的应用。做个简单的比喻,这款机器有点像一个越野车,它并不是给家庭,或者在城市里面使用的。很多情况下,比如出去户外或者非常复杂的一些环境下的运输,就可以使用它去做。

它可以变形成四条腿的模式,这样的话稳定性会更好一些。四条腿的模式下,它的稳定性是相对比较好的。而且越野能力也非常好,另外,这里也有我们前几个月演示的多模态端到端的自动AI动作生成,我们做一些很多常规的动作演示,都是用来提前做训练好的。这部分的话,它的动作都是基于实时的语音生成的。正因为是基于实时语音生成的,所以它中间会有点延迟,每句话说好了以后,它要语音识别,识别以后上传到云端,云端做一些AI动作生成,动作生成了以后做一些动作验证,验证好没有问题以后才下发给机器人,所以说整个过程还需要几秒钟的延迟。

但是我们希望未来真正的机器人应用落地的时候,它的动作都是完全实时生成的,而不是提前做编程的。因为有个语音延处理的过程,会有点延迟。

我们也在推动一下机器人真正的像在会议室里真正的干活,我们在这里的话,主要采集和训练,在一个会议室。如果我们把物品任意打乱以后,它都可以把会议室恢复到一个干净整洁的状态。完全是端到端实现的,它的运动的效率还是相对是慢一些。而且是做任务的,我们在这个场景里的话,大概有布置了7、8个不同的任务吧,用一个模型让它自动切换,不同任务都能直接实行。而且是可以抗干扰的。

正因为是AI实时生成和实时识别的,大家可以看到它动作可能没有那么流畅,它每走一步的话,动作都会要进行推理,动作丝滑性会稍微差一些。这个视频本身是一镜到底实现的,没有做过剪辑,如果有干扰也可以实现。

回顾一下最近几年AI模型的发展,最主要的流派主要是VLA模型,还有世界模型。那今年大家可能听到最多的还是世界模型方向。

像我们公司的话,对AI模型这块的投入一直是非常大的,是我们公司目前资金和人力投入最大的方向。在2020年初,我们就开始做基于视频生成的世界模型方向。

2020年底的时候,我们当时做的效果不是特别理想,中间稍微搁置了一段时间。去年,我们又大力的发展了基于视频生成的世界模型方向。

大家可能会很多人都会好奇,真正的通用的机器人什么时候,无论是人形机器人也好,或者说半人形机器人也好,什么时候真正的走进生活、走进家庭?

全世界目前最大的瓶颈,还是就是具身智能的泛化能力还不太够。简单来说,就是目前的很多AI模型,在全世界范围内,在一个固定场景上,做足够的采集训练,成功率基本上可以做到100%的,接近100%的成功率。但是如果操作的物品或者环境稍微换一下,成功率下降还是非常严重的一件事。所以我希望就是未来快的话,可能2到3年;慢的话或者5到10年。

如果哪一天大家能看到,把一台机器人带到任意的一个陌生环境,带到你的家庭,它基本可以实现80%左右的任务,我觉得就差不多已经实现了具身智能的GPT时刻,这就是未来真正产业临界的爆发点。

目前要达到这个时刻最大的一个瓶颈是什么呢?是目前的A I模型输入和输出跟机器人对齐程度不够。如果你让它移动,或者说:“哎,我要把什么东西装配在一起”,或者说:“要把一个物体搬到那个哪个问题”,它的整个趋势是没有问题的,只能能执行你的任务,但是最后的几个厘米,或者最后的几个毫米的成功率,或者它偏差,它没办法很好的跟真实世界匹配。就是我去拿这个东西的时候,看到是已经快要拿住了,那最后一点点触觉、最后一点点误差,没办法很好的去修正它,导致它的成功率就暴跌的非常非常严重,这个是目前全世界具身智能的最大的瓶颈,就是AI模型的输入和输出,它的跟真实世界有偏差的。

为什么机器人上会有这个问题?在一般的语言模型或多模态模型上没有这个问题呢?因为语言模型大家知道就是。它的数字完全是数字编码的,就是一个文字。你输入是什么,输出什么?它是在严格限制在它的一个向量空间里面,它基本上不会有大的偏差。

简单来说,它是没有损失的,就是它输入输出再把它倒回来,没有任何损失。关于对于机器来说,它的输入输出每输入输出一次,它都有偏差和都有损失,所以导致了目前全世界模型,真正的泛化能力和成功率会稍微会差一些的原因。

全世界这个模型,就是刚才也提到,就是真正的泛化能力和成功率会稍微会差一些的原因。但是我觉得,在未来几年,这是必然。然后,另外的话,我再这里介绍一下我们昨天刚刚提出的,或者公司的一个,就是我们正在预言做的一件事情。

我这里介绍一下我们正在做的一件事情。过去的很多年,大家已经因为AI做很多的编程,或做一些A I开发,但是对于A I的真正使用,我觉得在机器领域的开发上,还是相对比较欠缺。公司最近一段时间,我们在推动的一件事情。直接让物理A I计算模型自进化,使用目前最前沿的、顶尖A I大模型来驱动,我们自己定一些规则、定一些经验,包括定一些约束和工具。

让他自己去网上搜索最新的一些论文、最好的一些研究成果、最好的一些各种的一些开源方案,让他自己去编程生成自己的机器人的控制代码。控制代码生成以后,他可以在仿真环境里面运行,或者说在一些去生成一些呃。调用一些大模型状态,然后去控制一个实物机器人。

如果实物机器人,我们在实物机器上做一些部署测试,然后进行评价和打分。这个评价和打分的一部分是机器人AI模型自己实现的。

还有一部分就是,也可以人肉参与去评价和打分,因为人的经验非常重要,人很容易判断出来这个是好的和坏的,这个非常重要。所以说这套逻辑成体系,但是。运行起来,它的整个机器的开发效率会高很多,而且整个迭代速度也会非常非常快。

一旦这个流程运行一段时间,真的可以实现机器人的自我的进化能力提升。

这里也有简单一个事例,就是怎么做的,就是左下角就是一个coding的智能体,他自己编写机器的一些控制代码,包括很多代码。如果有兴趣,大家可以试一下,目前很多简单的深度强化学习算法。其实让很多的coding的程序,它自动编程的效果还是不错了。另外,把这份编程效果放到仿真环境里面去做验证、训练,训练好了以后,我们再把它放到输入机器上去做测试,测试好了以后,做A I模型,包括人肉去打分评价,确定这个效果怎么样,把它反馈给我们的那个编程智能,形成一个正向循环。

这里是个最简单的事例,真正使用的时候会比这个更加复杂。未来几年,全球我觉得这非常值得做的一件事情。第一点就是,随着每个月、每年基础模型的能力提升,这个自信进化循环本身能力就会进一步提升,这件事情某种意义上是可以达到跟随整个全球A I技术进步的。另外的话,就可以更使用多元的数据。

人肉的去使用数据是效率非常低的,使用自循环的话,可以把各种的数据、训练数据,包括真实世界、人的数据,都使用起来,这样使用的效率会更高一点,可以有更多的真机部署。随着我们真机部署越来越多,有更多的测试数据,包括有更多的评价指标在里面。

这样,整个的数据利用率和增长率是有可以保证的,能达到数据的规范化,我们也可以每天或者每个月叠加些技能,而不是说:“今天开发了个技能,明天又把这个技能浪费掉了。这是非常重要的事情,就是真正使用AI把这个机器人的开发效率,或者把机器人进化效率大幅度提升,未来是非常值得做的一件事情。这也是可以开启一个物理A I机器人资金化的一个新的机缘吧。

我觉得未来十年,在当下新的期间,尤其在AI大爆发,全球大家的关注度非常高的时间,整个的机器人进化速度已经大幅度提升了。未来发展速度可能比我预估的还会更快一点,是一个全新的起点、全新的开始。

(文中内容和观点仅供参考,不构成投资建议。投资有风险,入市需谨慎。)

编辑|邱慧