8月20日上午,宇树科技创始人暨CEO&CTO王兴兴在2026世界机器人大会主论坛发表题为《从展品到产品:人形机器人产业的下一个十年》的演讲。就在前一天,宇树科技刚刚登陆上海证券交易所科创板,上市首日收盘较发行价上涨460%。王兴兴在演讲中给出的个人判断是:具身智能达到类似“ChatGPT时刻”的产业临界点,快则可能还需2至3年,慢则可能需要5年甚至10年。

打开网易新闻 查看精彩图片

王兴兴没有把这一节点等同于某项固定场景演示,而是给出了一条更严格的判据:在80%的陌生场景中,机器人接受语音或文字指令后,能够顺利完成大约80%的任务。现场投影片使用“迈向”一词,意味着这仍是一道尚待跨越的门槛,而不是已经实现的能力。

在他看来,真正的瓶颈出现在任务的“最后几厘米”甚至“最后几毫米”。机器人在固定场景充分训练后,成功率可以接近100%;但物品或环境稍有变化,成功率就可能明显下降。移动、搬运或装配的大方向通常没有问题,困难在于末端误差和触觉反馈仍难以与真实世界准确对齐。王兴兴因此把核心挑战概括为AI模型的输入输出与真实机器人之间的对齐问题。

围绕如何跨过这道门槛,宇树展示了一套标为“预研”的“物理AI机器人自进化V1.0”框架。其设想是由AI大模型驱动系统自动调研、生成控制代码并在仿真环境中训练,再部署到真机测试,由AI和人共同评价,最后把结果反馈给编程智能体,形成持续迭代的闭环。

宇树把基础模型能力、多源数据、真机部署和技能积累列为这套路线的关键变量:基础模型能力提升可以增强自进化循环;更多真机部署则带来更多测试数据和评价指标,技能也可以持续累加。不过,这些内容仍是公司提出的预研技术路线,并非已经独立验证的商业化成绩。

演讲还回顾了宇树从四足机器人到人形机器人的产品进展,并播放了机器人装配、整理会议室、语音生成动作和执行取药盒指令等演示。

以下是王兴兴演讲实录

王兴兴:尊敬的各位领导、各位嘉宾,大家好。非常荣幸在这里做分享。先回顾一下公司的情况。宇树在2016年8月成立,到现在将近十年。公司最早做四足机器人,最近几年开始做人形机器人。我们近几年做得比较成功的一款产品,是2024年推出的G1。它推出后,基本成为了全球的一个标杆性产品。目前公司绝大部分机器人产品,以及全球不少在用的产品,要么就是这一款,要么在外观上与它非常相似。今年年初另一个有代表性的项目,是春晚节目《武BOT》。

《武BOT》融合了中国经典的传统功夫文化。我们提前采集了几十个经典的中国功夫动作,进行AI训练,再把精彩动作放到舞台上。这个节目的最大亮点,是把当前全世界最顶尖的人形机器人技术和中国传统功夫文化结合起来。视频在海外传播得尤其好,可能有几百亿次播放量。大家很喜欢,我觉得这是一个科技和文化交融的好例子。

2月份,我们还在天坛做过一次演示,现场大概有49台机器人全自动表演。天坛有几百年的文化和历史,机器人在现场给人一种穿越时空的感觉:过去几百年的中国文化和当前最新的技术交融在一起,非常震撼。

过去几年,我们一直在推动机器人真正走进生活、进入工厂干活。2024年,我们与汽车工厂合作,做了一些汽车工厂的落地应用;我们也在自己的工厂部署机器人,开展测试和应用。公司绝大部分AI团队都在做这件事,希望机器人真正能在家庭或工厂里干活。

为什么现在还没有大规模推广?最主要的原因是效率和泛化能力还不够。虽然机器人已经能做一些简单装配,但效率比人低;每次有新任务,还需要重新训练,效率也比较低。我们希望把技术做到更加泛化、能力更好,再进行大规模推广。这是目前全球共同面对的最大瓶颈。今年4月,我们还刷新了一项人形机器人的奔跑纪录,速度超过10米每秒。

H1是公司的第一款人形机器人,非常经典。后面也可以在它上面装轮子,让机器人更加灵活。

现在的机器人基本都是AI驱动,而AI基本由数据驱动。有多少数据,尤其有多少高质量数据,就有多少AI。我们既自己采集数据,也与第三方公司合作采集更多数据,供大家和我们自己使用。数据驱动是非常重要的一件事。

我个人感觉,AI机器人的训练仍要以海量数据作为主要的预训练基础,其中包括互联网数据,再加入部分真机数据。这两部分数据都非常刚需。从数量上看,预训练数据会更多,也更加重要;真机的实际数据同样重要,因为我们需要让机器人真正与物理世界匹配。今年5月,我们发布了应该是全球第一款量产级载人机甲。它身高3米多,载人后重量大约500千克。

打个比方,这款机器有点像越野车,并不是给家庭或城市环境使用的。比如户外活动,或者复杂环境下的运输,都可以使用它。它还可以变形成四条腿模式,稳定性和越障能力会更好。这也是为什么我们把它拿出来预售。简单来说,可以把它理解成一辆越野车。

这里还有我们前几个月演示的、基于多模态端到端模型的自动AI动作生成。很多常规动作演示都是提前训练好的,但这部分动作基于实时语音生成,所以中间会有延迟:一句话说完后,要先做语音识别,再上传云端进行AI动作生成;生成后还要做动作验证,确认没有问题才下发给机器人,整个过程需要几秒钟。我们希望未来机器人真正落地时,动作能够完全实时生成,而不是提前编程

演示指令:双手平举,向前走几步,然后再走回原点。

王兴兴:因为有语音处理过程,所以会有一点延迟。

这种自动生成方式也有一个不太好的地方,就是每次生成的动作会有差异。对它说同一句话,今天和明天做出的动作可能会略有不同。

演示音频:好的,准备开始。先半蹲着向前。

王兴兴:我们也在推动机器人真正到会议室里干活。我觉得会议室整理是一个很刚需的场景。每家公司都有很多会议室,如果会议室乱糟糟的,会比较麻烦。我们在这里主要采集和训练一个会议室场景:把场景任意打乱后,机器人都可以把它恢复到干净整洁的状态。

因为完全通过端到端模型实现,它目前的运动效率还比较慢。这也是一个多任务场景,我们布置了大约7到8个不同任务,用一个模型自动切换,不同任务都能执行,而且可以抗干扰。

正因为动作由AI实时生成和识别,所以它可能没有那么流畅。机器人每走一步都要推理,动作的丝滑程度会差一些。

这个视频是一镜到底,没有剪辑,也展示了机器人在受到干扰时仍然可以完成任务。时间关系,这里不全部播放。大家有兴趣可以到我们的官方网站看更详细的内容。

这个功能是我们最近一直在开发的。会议室整理有实际价值,难度又不算特别高,我觉得很值得做。前面的语音自动生成技术只生成动作,不带交互或干活能力;接下来的演示是在语音驱动下,让机器人执行实际任务。

王兴兴:“笨笨同学,帮我把药盒放到上面来。”

机器人:“好的,马上帮你把第三层的蓝色药盒放到上面来。”

王兴兴:“你看到了几盒药?”

机器人:“我用眼睛给你看看。一共有三盒药:一盒红色、一盒蓝色、一盒黄色。”

王兴兴:它可以抗干扰,并不是执行固定动作。前段时间,我们还发布了最新一代轮足机器人As2-W。这款机器人比较轻量化,自重大约20千克,但负载能力和续航很强,基本可以防雨水,室内和室外都能使用。

它相对比较轻量,在日常生活或一些工业场景中使用都会很方便。

我们把一部分人形机器人技术重新放到四足机器人上,进一步提高四足机器人的灵活性和负载能力。我们希望它能真正落地到户外徒步等场景。前段时间,我们也升级了去年推出的小型As2机器人的灵活性。

这款机器人性价比很高,在京东、淘宝上已经可以预售或零售。前段时间,我们还预研了一款新机器人。它的开发时间比较短,到现在只用了三个多月,目前只是预研产品,还没有正式发布。它的速度达到12.65米每秒,超过了人类最快奔跑速度;跳跃高度也基本超过了人类最高跳跃高度。2025年,我本人、公司产品和公司还登上了《时代》杂志的一个榜单。

再回顾一下最近几年具身智能AI模型的发展。目前主要流派包括VLA模型和世界模型,今年大家听得最多的可能还是世界模型。公司对AI模型的投入一直很大,应该是目前资金和人力投入最大的方向。2020年初,我们就开始做基于视频生成的世界模型,但到2020年底效果还不太理想,中间搁置了一段时间。去年,我们又大力发展了基于视频生成的世界模型。

很多人会问,真正通用的机器人,无论是人形还是半人形,什么时候能真正走进生活和家庭?目前全球最大的瓶颈,还是具身智能的泛化能力不够。很多AI模型在固定场景中进行充分采集和训练后,成功率可以接近100%;但只要操作物品或环境稍微改变,成功率就会严重下降。我希望,未来快的话可能需要2到3年,慢的话可能需要5年甚至10年。如果有一天,把一台机器人带到任意陌生环境或家庭,它基本可以完成80% 左右的任务,我觉得就差不多实现了具身智能的ChatGPT时刻。这将是真正的产业临界爆发点。

这个评价指标很简单:在80% 的陌生场景中,通过语音或文字指令,机器人能够顺利完成大约80% 的任务。我觉得这是一个非常重要的临界点。要达到这个时刻,最大的瓶颈是AI模型的输入输出与真实机器人的对齐程度还不够。

现在的机器人模型,如果让它移动、完成装配,或者把物体搬到某个位置,大方向通常没有问题,大差不差能够执行任务。但到了最后几厘米甚至几毫米,它没办法很好地与真实世界匹配。拿东西时,明明已经快要拿住了,最后一点触觉或误差却无法很好修正,导致成功率暴跌。这是目前具身智能最大的瓶颈:AI模型的输入输出与真实世界存在偏差。

为什么机器人会有这个问题,而一般的语言模型或多模态模型没有?语言模型处理的是数字编码,输入和输出严格限制在向量空间里,通常不会产生大的偏差。简单来说,它的输入输出是无损的。但机器人每次输入输出都会产生偏差和损失,所以模型的泛化能力和成功率会差一些。我认为这个问题在未来几年必然可以解决,只是需要时间。

我再介绍一下公司正在预研的一件事。过去几年,大家已经使用AI进行编程和开发,但AI在机器人领域的实际应用还相对欠缺。公司最近正在推动的方向,是让物理AI机器人模型自进化:使用前沿AI大模型来驱动,我们定义规则、经验、约束和工具,让系统自己搜索最新论文、研究成果和开源方案,再自己编程,生成机器人控制代码。

控制代码生成后,可以先在仿真环境中运行,再部署到实物机器人上测试。我们会对结果进行评价和打分,其中一部分可以由机器人AI模型完成,另一部分也可以由人参与。人的经验很重要,人很容易判断结果是好还是坏。只要这套体系运行起来,机器人的开发效率会提高很多,迭代速度也会加快。流程运行一段时间后,就可以真正提升机器的自我进化能力。

这里有一个简单示例。左下角是一个编程智能体,它自己编写机器人的控制代码。现在一些简单的深度强化学习算法,交给编程智能体自动编程,效果已经相当不错。代码先放到仿真环境中验证和训练,再部署到实物机器人上测试;测试后,由AI模型和人共同评价打分,再把结果反馈给编程智能体,形成正向循环。

这只是最简单的示例,真正使用时会复杂得多。我觉得,这是当下以及未来几年全球都非常值得做的一件事。

为什么要这样做?第一,随着每个月、每年的基础模型能力提升,自我进化循环本身的能力也会进一步提升。从某种意义上说,它能够跟随全球AI技术一起进步。

第二,它可以使用更多元的数据。人工使用数据的效率很低,而自循环可以利用各种训练数据,包括真实世界和人的数据,提高数据使用效率。更多真机部署也会带来更多测试数据和评价指标,使数据利用率和增长率得到保证,走向规模化。技能也可以每天或每月持续累加,而不是今天开发一个技能,明天又把它浪费掉。这件事很重要,它能让AI大幅提升机器人开发和进化的效率。

我认为这个方向未来非常值得做,也可能开启物理AI机器人自进化的新纪元。过去十年,我们大概在2017年或2018年第一次参加世界机器人大会,当时感受很深。展望未来十年,在AI大爆发、全球关注度很高的时期,机器人的进化速度已经大幅提升,未来发展可能比我预估的还要快。这是一个全新的起点、全新的开始。由于时间关系,汇报比较简单,谢谢大家,还请大家多多包涵。(易句)

(本文由AI撰文,网易编辑负责校对)