昨天,宇树科技刚刚登陆科创板,王兴兴身家飙升至千亿,成为科创板最耀眼的90后首富。
今天一早,他就出现在WRC世界机器人大会。没有演讲稿,没有PPT封面,穿着一件白衬衫,开口后也没提上市,而是直面行业灵魂拷问:机器人到底什么时候才能真正走进家庭?也坦承“过去很多动作演示是提前编程好的,但未来机器人必须能实时生成动作。”更重要的是,他揭秘透露,宇树最近在赌的一个大招:“我们最近真正在预研的一个方向,可能会更根本地改变游戏规则——让机器人实现‘自进化’。”
以下是王兴兴分享内容,经《i黑马》整理编辑:
大家好。我们公司成立十年,从机器狗做到人形机器人,一直在推动一件事:让机器人真正走进生活和工厂。2024年我们就和汽车工厂合作,也在自己工厂做测试。但目前没有大规模推广,核心原因就两个:效率和泛化能力远远不够。
简单说,在固定场景做固定任务,通过大量训练,成功率能接近100%。但只要换一个房间、换一个物品,或者任务稍有不同,成功率就急剧下降。
而且,机器人做简单装配的效率比人工低,每次新任务都要重新训练,部署成本太高。这是全球共同面临的最大问题。
很多人问,通用机器人到底什么时候能真正进入家庭?
我的判断是,需要一个明确的临界点:把一台机器人带到80%的陌生场景中,仅通过语音或语言指令,它能完成80%左右的任务。
快的话两三年,慢的话可能五年或更久。达到这个“两个80%”的时刻,就是产业真正的爆发点。
为什么现在达不到?最大的技术瓶颈,是AI模型的输入、输出与真实物理世界的对齐存在偏差。
比如让它去拿个东西,大的方向没错,但往往在最后几厘米甚至几毫米,因为触觉反馈或微操误差无法修正,导致任务失败。
这个问题在语言模型中不存在,因为语言处理的是纯数字编码,输入输出没有损耗。但机器人每一次感知和控制都有物理偏差,误差累积起来,成功率就暴跌了。
这是目前泛化能力差的根本原因,也是我们必须解决的核心难题。
过去很多动作演示是提前编程好的,但未来机器人必须能实时生成动作。
我们现在已经做到基于实时语音生成动作:你说一句话,它识别后传到云端生成动作,验证后再执行。目前还有几秒延迟,而且每次生成的动作会有差异,但这正是AI实时生成的特点——它不是死记硬背,而是现场理解、现场发挥。
更进一步,我们让机器人不仅做动作,还要带着任务去干活。比如搭载多模态大模型后,它能识别环境、抗干扰,完成装水这类操作。我们还在会议室场景做了多任务整理,布置7-8个不同任务,同一个模型自动切换,能把杂乱的空间恢复整洁。虽然动作还不够流畅,但这个方向有实用价值。
我们的机器人形态不限于双足。今年5月发布了3米多高的载人机甲,重约500公斤,能变形成四腿模式,像越野车一样用于复杂环境运输。轮足复合机器人更轻量化、防水,适合户外徒步。我们还预览了一款叫“超人”的人形机器人,开发仅三个多月,奔跑速度已达12.66米/秒,跳高也超过了人类历史纪录。这些硬件进步,为AI提供了更好的物理载体。
以上是短期能看到的进展。而我们最近真正在预研的一个方向,可能会更根本地改变游戏规则——让机器人实现“自进化”。
具体来说,我们设定一些规则和工具接口,然后让最前沿的AI大模型自己去网上搜索最新论文、开源方案,自主编写机器人的控制代码。代码生成后,先在仿真环境运行,再部署到真机测试,最后由AI和人工一起评价打分,把结果反馈给编程智能体,形成闭环。
这个体系一旦跑通,有几个巨大优势:
第一,它会随着基础模型的能力提升而同步进化,形成良性循环。 第二,它能高效利用多元数据,不用依赖低效的人工处理。 第三,真机部署越多,测试数据就越多,技能可以不断累积,而不是今天开发明天就浪费掉。
我认为,这是未来几年全球最值得探索的方向,它将开启物理AI的新时代。站在AI大爆发的起点,我坚信未来十年机器人的进化速度,会比所有人预估的都要更快。
热门跟贴