“我们距离物理世界AI Agent时刻到来已不再遥远,不需要等五年甚至十年。”在2026世界机器人大会上的主题演讲中,自变量机器人创始人、CEO王潜很有信心地作出这一判断。
他认为,具身智能正走在语言模型五年前走过的道路上,可获得很好的Scaling up效果,同时涌现能力包括Few-shot(少样本学习)也逐渐显现。
在今年世界机器人大会的演讲中,王潜围绕具身智能的模型、数据、AI Infra和场景落地谈了自变量所做的工作,以及不同于行业认知的独特思考。
人脑看模型:端到端是自然进化结果
“相比去年,行业讨论的重点已经从硬件转向谈论机器人的大脑、大模型。但模型究竟在AI版图中占据怎样的位置?仍然众说纷纭。”王潜说道。
他指出,对人类高级能力的研究和观察有助于厘清智能的本质。“人类在超越动物的进化中,出现了两个标志性能力,一是使用工具,二是使用语言。这两者某种意义上恰好指向了智能的本质。”
王潜谈到,现在大家都希望具身智能能实现精细操作,但其实这件事情的复杂度极高,甚至不亚于语言、思维等高级能力。这是因为复杂物理过程与巨大参数空间相遇,产生了「可怕的维度爆炸」。
若从人脑进化结果来看,负责精细操作的脑区比全身运控脑区规模更为庞大,甚至基本与语言、思维等高级能力所占据的脑区面积相当。更重要的是,精细操作能力所对应的脑区是人脑进化中出现最晚的部分。
基于这样的客观现实,技术层面有办法突破吗?王潜分享了三点思考:
1、端到端模型好于分层模型:人类大脑的工作模式通常是高级脑区逐级向下传递指令,但在手部等精细操作上,人脑采用了跨层级的控制模式,即由最高层级脑区直接控制最低层级动作。“端到端不仅是人类自身的选择,更是自然演化的结果。”
2、比起后训练,应当多做预训练:尽管人们常常把视觉(Vision)、语言(language)和动作(Action)放在一起讨论,但无论是维度还是表征属性,动作模态与视觉、语言模态之间都存在显著差异。与此同时,物理世界的交互数据较为稀缺,互联网上的视频对这类行为的描述质量也较差,即使是异构数据,对物理过程的表述也不尽如人意,物理智能不能简单涌现自虚拟世界。
3、汇集所有模态做通才模型:将视觉、动作、语言等表征纳入同一个模型,多模态进,多模态出,使模型真正意义上跨越单一模态和任务的限制掌握包括逻辑和物理规律在内的通识。也就是说,物理世界需要真正服务于自己的基础模型,这个模型是某种意义上的大一统模型,应该完全平行于数字世界的模型。
数据并非人工智能时代的石油
当模型逐渐趋同,数据将成为主要差异。
王潜注意到,今年行业已经普遍认同数据的重要性甚至高于模型,但大家对模型本质的认知仍存偏差,目前有种说法是「数据是人工智能时代的石油」,自变量对此提出了不同的看法。
“提到石油,大家会认为它是原材料,是标准化、不需要复杂处理的资源性质的东西,但我们实际做模型时,最深刻的感受是数据应被理解为某种意义上的工业品,它高度复杂。”王潜说。
在自变量方面看来,构建一套高质量数据体系的复杂度甚至远高于构建一个高质量模型,其复杂度堪比从零打造一台机器人。
高质量数据的获取难度体现在链路长——从数据的定义、采集、判别、处理,到反向优化前序环节,包含着大量工作,以自变量为例,其数据管线中部署了多个用于自动化提升的模型。
“最终能够用于模型训练的数据的生产链路长度甚至不亚于机器人本体和模型的研发,甚至还要更长。”王潜说。
然而,这一点尚未被行业充分认知,导致大家投入大量精力采集数据后,发现数据实际用处有限,如果对数据的本质属性有更充分的理解,这样的浪费本可避免。
据介绍,目前自变量已发布多份报告,其中一个关键突破是实现机器人硬件本体的精确回放——人在采集设备上完成任务后,相关数据可以映射到机器人本体,并以较高成功率回放相同任务。
自变量的实验获得了一个关键结果,即用10%的真机数据和90%的无本体数据追平100%真机基线。在数据总量不增加的情况下,数据效率实现了至少10倍的提升。
王潜认为,即便是看似门槛较低的数据采集硬件,都仍然有大量的挖掘空间,更不用说数据处理、数据定义和整体管理。这也促使自变量选择大量开源,“当数据规模扩大到一定程度后,仅靠一家企业很难推动整个产业进步,应建立相应产业生态。”
具身的AI Infra比语言模型难得多
在语言模型领域,AI Infra已被广泛讨论,DeepSeek之所以表现优异,AI Infra在其中发挥了极大助力,使其能够以更少的资源或在同等资源条件下获得更高的效益。
然而在具身智能领域,AI Infra还未被普遍提上议事日程。王潜指出,随着模型规模和数据量的快速增长,具身智能领域将很快面对像语言模型训练时的训练体量,届时AI Infra将成为刚性需求。
他表示,自变量也为行业准备了大量开源的公共工具。例如自变量发布了分布式训练优化器DMuon,对Muon神经网络优化器进行分布式改造,去掉了原先50%的额外通信带宽,获得了约30%的收敛速度的提升。
他认为,这一成果不仅可以服务于具身领域,语言模型领域也会从中受益,“很有可能大家看到的下一个版本的语言模型就是由这个优化器所训练。”
再比如,自变量搭建了一套面向具身大规模强化学习的在线学习框架,连接起机器人集群、数据中心、训练集群和模型服务中心。机器人在真实环境中执行任务并产生数据;数据经过处理后进入训练系统;新生成的Checkpoint再返回机器人端继续执行,形成持续迭代闭环。
“整体而言,具身智能的AI Infra并不比语言模型的AI Infra简单,甚至要困难得多。”王潜说,无论是强化学习还是FFT预训练,都必须与硬件深度交互,而硬件本身的特性又会带来大量通信、同步、训练上的特殊问题。
他表示,自变量在这些方面积累了大量经验,愿意为合作伙伴提供相应服务,帮助其获得更优的模型效果。
重走LLM五年前的路
“开源应当被看作极为重要的事。”
王潜说。在具身智能领域,开源并非单纯为争夺竞争优势,毕竟当前中国的具身智能发展水平仍可以说处于全球领先水平,开源的核心目标实际在于加速整个产业的发展进程。
目前,自变量开源了整套的模型参数、训练过程、部署方案以及部分基础设施和部分数据。在模型层面,虽然尚未开源大一统模型,但开源了VLA模型WALL-OSS-0.5和WALL-WM世界模型。
据介绍,VLA模型可在不进行后训练的情况下,仅依靠预训练就能直接执行部分真实机器人任务。WALL-WM世界模型的特点是基于事件而不是基于均匀的时间长度来做预测,比如抛出一个球是一个事件,而当球与其他物体发生接触时又构成一个事件,每次预测的时间跨度不同,自变量会根据任务难度动态调整所需的计算资源,此种方式帮助提升了视频生成能力和机器人操作能力。
当前,全社会乃至全球对机器人模型发展的认知度与实际进展之间存在微妙的错位:有时过度乐观,例如许多人去年在问机器人是否一年内就能走入家庭;有时又过于悲观,比如今年人们又认为至少需要五到十年。开源在其中扮演着至关重要的角色,一方面帮助培养人才,另一方面可以推动基础设施在开源生态中获得持续提升。
王潜认为,大家一直在寻找的具身智能「ChatGPT时刻」迹象已显:“具身智能正走在语言模型五年前走过的道路上,它能获得很好的Scaling up效果,同时,涌现能力包括Few-shot(少样本学习)也逐渐显现。”
对于现有技术路线达不到少样本学习的观点,王潜并不认可,他相信当前的方向的正确性,有非常高的确定性能达到物理世界的AGI。
具身智能的终极拷问
所有技术的投入,最终需要回答一个核心问题——它们是否真正有用。
王潜指出,此前在生产力场景中,具身智能尚无法证明自身的实用价值,更多应用还是在提供情绪价值的场景里,但现在具身智能在产业场景里展现的能力,是上一代机器人无法胜任的。
据他介绍,自变量的WUM(世界统一模型架构)正落地某头部物流公司的真实工业产线,基于该模型,机器人可根据实时场景识别、抓取和分拣大量不规则、堆叠的包裹。“更重要的是,该落地所取得的ROI已达到甚至超过人类水平。”
他认为,上述成果也验证了通用模型路线的正确性。据介绍,得益于基座模型强大的泛化能力,自变量完成上述产业场景仅用了三个月,而海外同行花费了两年半。“通常来说,三个月连工程部署或生产都不够。即便在‘沿途下蛋’的场景里,基础模型也能做到比专用模型、专家工程、单点模型更好的效果、更低的成本和更快的速度。这已不是未来时,而是现在时。”
王潜认为,具身智能或物理世界AI Agent时刻的到来已不再遥远,不需要等待五年甚至十年。
“五年后回望,机器人很可能已在千行百业、千家万户中得到极其广泛的应用,我们无比期待这天的到来。”
热门跟贴