编辑|泽南、张倩
这可能是WRC最「硬」的通用具身智能展台。
世界机器人大会的现场,一台机器人正在低头插花。
它能根据观众选择的花枝和花器,自主判断长短、角度和配色,自动搭配出一捧错落有致的花束。
展台另一侧,有同款机器人在叠衣服、取外卖、去冰箱取饮料:
再往旁边走,两条机械臂正一递一接,把面单逐一翻转朝上,几乎不停顿地分拣包裹。在此前的一场公开直播实测中,这套产线跑出了每小时 1816 件的分拣效率。
有意思的是,这些看起来毫不相干的工作,是由同一个「大脑」驱动的。机器人展示的也不是为大会临时编排的 Demo,只是把已经规模化运行的真实业务搬了过来。
这就是自变量机器人(X Square Robot)在本届 WRC 上交出的答卷:在大家还在秀「机器人未来能做什么」的阶段,自变量已经在告诉你「机器人已经解决了什么问题」。
你们的机器人会铲猫砂吗?
「你们的机器人,能不能帮我们去铲猫砂?」在展会现场,自变量的技术人员跟我们聊起来他们遇到的一些意想不到的需求,并坦言这是家庭机器人的常态。
那这些需求能满足吗?从训练的角度来看,你其实很难穷尽每种任务,自变量也坦言这个任务不在他们训练的预设清单里。但这并不代表他们的机器人做不了,因为敢进军家庭,凭的就是处理各种未知任务的能力。
在现场,我们看到机器人居然在铲猫砂。除此以外,它们还能叠衣服、取外卖、取可乐、收拾茶几、整理鞋柜、取抽纸、套垃圾袋、取零食、自主巡检、浇花、整理桌面、关灯,完成数十个家庭场景任务。其中的很多任务,机器人在预训练中都没见过,但它们依然能靠对物理规律的底层理解来完成。
而且这些任务,只是它们提供日常服务过程中的一个子集。今年 3 月,自变量和 58 到家推出了机器人上门家政服务,机器人跟保洁员搭班,一起完成清洁和收纳;5 月又启动「X 家庭成员计划」,让机器人直接在用户家里住下来,最长常住一个月,在连续、真实的生活环境里干活。到今年 7 月,这个「机器人进家庭项目」还入选了 APEC 官方发布的《亚太地区数智赋能案例集》,是其中唯一一个用具身智能服务民生的案例。
这就是为什么,同样是在 WRC 摆一个家庭场景,自变量的展台气质不太一样:别人家的机器人是在「表演」家庭生活,它家的机器人是在「上班」干活,甚至干完活还会自己去充电。
展台的另一侧,一双高自由度的灵巧手在拆快递盒、取出了小电扇,还能给观众打开吹风,动作细到让不少人停下来录像。
可以看到,这是目前行业公开演示里最「广」的家庭服务。但广度本身不是重点,重点是这些能力是从真实服务里长出来的:机器人每多进一个家庭,就多接触一批训练清单上不存在的需求,这些交互的成功和失败经验又会反过来提升机器人的能力,「想不到的需求」就这样一条条变成「已经会干的活」。
展台会撤,但这些机器人后续要继续上门干活。这大概是 WRC 的展台上,为数不多「展会结束不失业」的机器人。
一小时 1816 件,物流大厂同款「分拣员」被搬到现场
从家庭展区走到物流展区,画风突变。没有花瓶和猫砂盆,只有两条机械臂、一条传送带,和源源不断长得完全不一样的包裹 —— 大的、小的、方的、软的、折成一团的……
这是自变量在 WRC 前夕公开直播实测过的同款产线,这次被原样搬进了展馆。我们在旁边看了一会儿,最直观的感受是:它不像在演示,像真的在着急干活儿。现场的传送带也是一点不客气,但凡机器人手慢一点,快递就堆满了,流水线压力拉满。
包裹是从真实物流场景里来的,大小、形状、材质、重量完全随机,机器人要做的事只有一件:把每个包裹的面单翻到合适位置,有时候多个包裹叠在一起还得把它们分开。机器人翻面翻到飞起,全程没有预设脚本,也没有停机。
然后是这组被反复提起的数字:在此前的公开直播实测中,这条产线跑出了 1816 件 / 小时的分拣效率。什么概念?美国头部具身智能企业 Figure AI 公开的同类数据是 1248 件 / 小时。也就是说,自变量快了 45% 以上
更值得注意的是成本。Figure AI 用的是「人形机器人 + 五指灵巧手」,自变量用的是「双机械臂 + 夹爪」。后者部署成本只有前者的约 30%,分拣准确率高达 98%,处理的还是真实随机包裹,没有定制的标准件。
这组对比有意思的地方不止速度,更在于它指向了两条完全不同的产业路径。
一条是堆硬件:用最像人的身体、最复杂的灵巧手、最精密的传感器,靠硬件性能去够能力上限。问题也很棘手:贵、脆、难维护。而工业场景恰恰对成本和稳定性最敏感:仓库要的是 7×24 小时连轴转,不是一尊需要精密校准、专项维护的「机械艺术品」。
另一条是自变量选的:让身体简单一点,让大脑聪明一点。夹爪结构简单、零部件少,故障率天然就低;双臂构型能直接对接现有仓储工位,不用大改产线,落地快,也好复制。本质上,是用通用模型能力的提升,去替代硬件的军备竞赛。
和家庭展区一样,这套东西也不是为大会特调的。此前,自变量已经与一家头部物流企业达成合作,分拣方案部署进了真实生产环境,常态化运行,并且过了「经济效益」这一关。在物流行业,这可能是比任何跑分都严格的测试。
而驱动这条产线的大脑,和隔壁展台插花、铲猫砂的,竟然是同一个。
会铲猫砂的机器人怎么还会分拣快递?
家庭和物流,是两类对机器人能力要求几乎相反的场景。
家庭环境高度开放,任务长程且随机,考验机器人在陌生环境中的泛化和应变能力;物流产线则更看重作业效率、操作准确率、运行稳定性和部署成本。兼顾这两类应用,对具身模型的通用性提出了很高的要求。
自变量驱动这两类场景的,是同一套端到端世界统一模型 WALL-B
今年 4 月发布的 WALL-B,是全球首个基于「世界统一模型」(WUM)架构的具身大模型。它把视觉、语言、触觉、动作和物理预测等所有能力放在同一个神经网络里,从零开始联合训练、融为一体。没有模块边界,没有数据搬运损耗,所有能力在同一个网络中原生协同。
这种原生统一带来了几个 VLA 架构难以实现的能力。
首先是原生多模态融合与空间推理。模型在感知的同时就理解了空间关系:杯子在桌子边缘、地面有水、椅子挡在路上,这些信息在同一个网络中被即时整合。WALL-B 还展现出一种「原生本体感」,不需要持续观察自身全身,就能内在感知自己的位置和手臂伸展范围,判断能否通过某个空间或触及某个物体。
其次是对物理规律的理解。WALL-B 能理解重力、惯性和摩擦力,推演不同动作可能带来的状态变化。推一个轻盒子和推一个重箱子该用多大力、物体会怎么动、会不会翻倒,模型能在动作执行前做出预测。它不需要见过完全相同的场景,就能实施推断并采取预防动作。
这种对物理常识的掌握,是零样本泛化的基础:物理规律在不同环境中是一致的,模型进入一个从未去过的家庭,可以用对重力和摩擦力的理解来应对新场景,不需要重新采集数据、重新训练。
第三是记忆与交互式自我进化。目前大多数机器人在任务失败后直接停止、返回错误信息。WALL-B 的行为模式不同:它会调整策略再次尝试,如果成功,就将这次经验直接更新到模型中。此前发布会上,自变量机器人联合创始人兼 CTO 王昊把它比作人类学用筷子:掉了无数次,但每一次失败都在调整手上的控制,最终形成稳定技能。
这意味着模型在真实环境中可以持续自主迭代,不需要返厂重训、不需要人工注入新数据。
王昊还提出过一个「糖水数据」与「牛奶数据」的区分:实验室里光照固定、物体位置固定的干净数据像糖水,好喝但没营养;真实家庭中拖鞋散落、猫跳上桌、灯光忽冷忽热的嘈杂数据像牛奶,难采但有营养。WALL-B 的设计目标,就是让模型能直接消化「牛奶数据」,在真实世界的随机性中成长,而不是只能在「糖水」里训练、到了真实环境就失效。
这套通过预训练获得的通用能力,可以跨本体、跨任务、跨场景复用。今天驱动家庭机器人叠衣服,明天驱动机械臂分拣包裹,底层是同一个模型,不需要为每个场景单独采集大量数据、做针对性后训练或定制专用硬件。
这正是自变量理论的基础:物理世界的变化是无穷的,家庭有千万种户型,仓库有千万种包裹,不可能通过预设规则或穷举训练场景来覆盖。只有预训练、端到端的通用大模型,才能让机器人形成对物理规律和事件演化的统一理解,获得跨场景完成任务的能力。
当然,通用路线并非自变量独此一家。海外的 Physical Intelligence 靠海量真机数据做跨本体 VLA 泛化,Skild AI 做跨本体、跨任务的通用机器人大脑,科技巨头如英伟达 Isaac GR00T、Google Gemini Robotics 也在押注「一个模型通吃」。但在具体架构上,行业远未收敛。WUM 代表的「全能力原生统一」是一条激进且少数派的路径,它的长期优势还需要更多场景和更长时间来验证。
家庭和物流这两个场景的同时落地,为这条路线提供了第一次集中的实证:同一个预训练模型,不靠大量的针对性后训练、不靠定制硬件,同时在最开放的民用场景和最讲究效率的工业场景中跑通了真实业务。这在行业内并不多见。
真护城河:数据管线、基础设施
具身智能,模型只是冰山水面上的一角。
作为物理世界的 AI,具身智能与大语言模型的逻辑有着巨大差异。LLM 可以从互联网上海量的文本和图片中学习,但具身模型所需要的数据:接触、摩擦、重力、物体形变,只有真正进入现实物理环境进行交互才能获得。这类数据的采集成本高、规模受限,是行业当前的瓶颈。
同时存在的还有数据的结构性问题:数据质量失衡、标准割裂导致数据孤岛、闭环迭代效率低下。
自变量给出的解法是构建一套覆盖数据采集、加工处理、模型训练、真机部署和数据回流的完整工业级数据管线。
在数据采集端,自变量推出了QUANXTA Zero 系列无本体数据采集方案。这是业内少数的有自研具身模型和机器人本体的公司从源头定义数采标准,并开源了数采方案与相关方法。在 QUANXTA Zero 之上,人的动作被采集后,可以转化为机器人可学习的数据。
该系列具备行业唯一的「移动采集数据本体回放」能力,并且采集数据入库有效率超过 85%。
在此基础上,自变量实验证实了无本体数据与真机数据 10∶1 的混合配方,可以达到同等规模纯真机数据的效果,用大量低成本的无本体数据搭配少量高精度真机数据,能将模型训练所需的数据成本降低 95%。
当然,各家具身智能团队在采集质量、回放精度和数据清洗上的工程差异,才是真正拉开差距的地方。采集之外,自变量自研的数据管线还覆盖数据清洗、自动化标注、质量控制和数据增广,配合自研数据合成模型高保真复现真实世界中稀缺、复杂或危险的场景,将原始数据持续加工为模型可训可用的资产。
这套基础设施的效率有多高?在自变量举办的全球具身智能开发者大会(EAIDC)黑客松上,参赛选手仅用三天就完成了从数据采集、模型训练到真机部署的全流程。作为对比,专业研究实验室跑通类似流程通常需要六个月。
模型和数据之上,面向推理与部署,自变量还自研了具身大模型分布式训练与高性能推理框架,近几个月来开源的就有 DMuon 分布式优化器、HOST 单样本学习框架、X-Tokenizer 跨模态动作分词器等底层工具。
本体方面,自变量近期还量产了量子一号、量子二号两款机器人,实现机械臂、关节模组、动力驱动器、主控制器等核心零部件全面自研。
从数据到模型、从训练框架到硬件本体,自变量构建的是一条全栈自研的闭环。
具身智能产业化拐点比预想得更近
在 WRC 现场,最吸引眼球的展台展示的是机器人「能做什么」,跳舞、握手、走几步路,demo 都很精彩,但距离真实产业应用还有一段距离。自变量展示的是另一个维度:机器人「已经在做什么」,已经在哪里产生经济效益了。
家庭一侧,机器人正在走进普通家庭提供常态化服务,项目入选 APEC 官方案例集;工业的另一侧,分拣方案已在物流产线上常态化运行,通过了企业的经济效益考验。两个场景共享同一个模型底座,家庭场景积累的广泛交互数据驱动模型进化,工业场景验证技术的产业价值,二者形成数据与商业价值的正向循环。
资本也在用脚投票。据公开信息,自变量成立以来获得小米、美团、阿里、字节跳动、红杉中国、IDG 资本、中国移动链长基金等 30 余家机构投资,两个多月内连续完成 4 轮融资,估值突破 200 亿人民币。
2026 年被普遍视为具身智能走向落地的关键节点。当一家公司能用同一个大脑同时服务 C 端家庭和 B 端产线,把模型生产流程从六个月压缩到三天,这说明,通用具身智能的产业化拐点可能比大多数人预想的更近。这也是通用具身模型展现出的能够驱动各种场景应用的优越性。
如果每一台机器人都拥有聪明的「具身大脑」,走进千家万户、赋能千行百业,就不再是遥不可及的梦想。
热门跟贴