打开网易新闻 查看精彩图片

这项由小米机器人团队完成的研究,以预印本形式发布于2026年7月16日,论文编号为arXiv:2607.15330,有兴趣深入了解的读者可通过该编号查询完整论文。

如果你家里有一个机器人,你最希望它能做什么?叠衣服、收拾书包、把散落在沙发上的玩具整理进收纳箱?这些听起来平常的事情,对机器人来说其实极其困难——不是因为机器人力气不够,而是因为它根本不知道面对一个从未见过的房间、一件从未碰过的物品时,手该怎么动。小米机器人团队花了大量时间和精力,试图彻底解决这个问题。他们构建了一个名为Xiaomi-Robotics-1的系统,而这个系统背后的核心秘密,是超过10万小时的真实人类操作录像。

要理解这件事的分量,可以换个角度思考:10万小时,相当于一个人不睡觉地连续工作超过11年。这些录像记录的不是在实验室里精心布置的场景,而是在家庭、餐厅、办公室、工厂、户外等各种真实环境里,人拿着特制的手持抓夹装置(一种叫做UMI的工具,像手套一样让人在操作物体时自动记录手的动作)完成各种任务的过程。这套数据集涵盖超过1700个不同场所、240万个操作片段、260种以上的任务类型,是目前机器人领域规模最大的真实操作数据集之一。

一、为什么机器人学不会"随机应变"

要搞清楚Xiaomi-Robotics-1解决了什么问题,先得理解机器人为什么那么难"教"。

教一个小孩叠衣服,你只需要示范几次,孩子就能举一反三——今天叠蓝色T恤,明天换成红色毛衣,他照样能做。但机器人不行。传统的机器人培训方式,就像给一个人死记硬背"菜谱":告诉它在哪个位置抓、往哪个方向移动、放到什么高度,只要场景稍微变化,整套动作就全部失效。

这背后的核心矛盾是:收集机器人训练数据既贵又慢。让机器人真正在现场操作来录制数据,需要真实的机器人硬件、需要人在旁边操作遥控器、需要反复调试、还需要大量重复试验。更糟糕的是,这样收集来的数据高度重复,总是同一套任务、同一批场景,机器人学到的"经验"非常狭窄。

小米团队的突破在于换了一个思路:既然机器人的手不好用,那就先用人的手来收集数据。UMI装置让普通人手持操作就能生成高质量的动作数据,不需要真正的机器人在场。这个方法让数据收集的效率提升了数倍,也让数据的多样性彻底爆发。

二、从录像到"理解":给每段视频打上"说明书"

收集了10万小时的操作录像之后,下一个难题是:机器人看这些录像,能学到什么?

单纯让机器人看录像模仿,就像把一个完全不认识字的人扔进图书馆,他能看到每一页纸,却根本不知道上面写的是什么意思。机器人需要的不只是"动作画面",还需要"理解这段动作在做什么"。

传统做法是让人工来给每段录像写说明:这段视频里,人把红色的盒子从桌上拿起来,放进了背包。但面对10万小时的录像,这种人工标注完全不可行——如果每小时标注需要1小时,那就需要10万小时的人力,差不多等于50个人不休息地工作整整一年。

小米团队开发了一套自动打标签的流水线。他们首先把每段录像切割成固定长度的小片段,然后用一个已经很懂图像和语言的大模型(Qwen3.5-27B,一个能看图说话的AI)来自动描述每个片段里发生了什么状态变化——不是简单地说"手在动",而是具体描述"一只手抓着一块白布,正在擦拭桌面"或者"两只手把一条黄色毛巾对折,收叠起来"。

为了让这套流水线能以足够快的速度运转,工程师们设计了一个"生产-消费"并行架构:一组处理器专门负责把录像切成小片段存到内存里,另一组同时把这些片段送给AI打标签,两组互不干扰、同时工作。凭借这套设计,整整10万小时的录像,只用了大约两周时间就完成了全部标注。

有了这些语言描述,机器人在训练时就不再只是机械地模仿手的动作,而是学习"当我收到某种语言描述的目标时,应该产生什么样的动作序列,使场景从当前状态变成目标状态"。这是一个质的飞跃:机器人开始学会把语言和动作联系起来。

三、两阶段培训:先"博览群书",再"专项训练"

Xiaomi-Robotics-1的训练分为两个明确的阶段,两者之间的关系,就像培养一个厨师的过程。

第一阶段叫做预训练。在这个阶段,机器人并不急着学怎么用机器臂,而是先靠着那10万小时的UMI录像,广泛吸收各种场景下的操作经验。预训练的目标是让模型形成一种"通用操作感知"——知道在各种情况下,手(或者类似手的工具)应该怎么动,才能让物体从一个状态变化到另一个状态。这就像一个未来的厨师先在全球各地旅行,品尝各种菜肴,了解食材的特性,而不是急着拿起锅铲。

第二阶段叫做后训练。这时候,团队拿出了另一批数据:超过1万小时的真实机器人操作录像。其中包括他们自己收集的超过7200小时的移动机械臂和双臂机器人数据,覆盖多种家庭场景;超过1000小时的UMI数据,但这批数据配的是人类日常说话时会用的指令(比如"把黄色运动鞋放到鞋架上"),而不是状态描述;此外还有来自开源社区的Bridge V2、RT-1、DROID等数据集。

后训练的目标是让模型完成两个"适配":一是把在UMI手持夹上学到的操作技能,迁移到真正的机器人手臂上;二是把在状态描述语言下学到的能力,对接到人类平时对机器人说话时用的那种命令式语言。这两个适配都非常重要——没有第一个,机器人手臂不会动;没有第二个,你对机器人说"帮我把书包收拾好",它根本听不懂。

在后训练中,团队还用Qwen3.5模型对人工切割的视频片段重新标注指令语言,确保这批数据里的语言风格和真实人类与机器人对话时保持一致。同时,他们过滤掉了所有"静止"片段——就是那些机器人什么都没做、只是待着不动的部分,避免模型学到"不动"这个无效行为。

四、"大脑"的构造:两个专家组成的团队

Xiaomi-Robotics-1的内部结构也颇有设计感。它采用了一种叫做"混合变换器"(Mixture-of-Transformers)的架构,可以理解为由两个功能不同的专家模块合作完成任务。

第一个模块是视觉语言模型,基于Qwen3-VL构建。它的工作是接收摄像头拍到的当前画面和操作人员给出的语言指令,然后理解"现在是什么情况""要做什么"。除了理解这些信息,它还会直接预测一批候选的动作方案——但这些方案更像是"草稿",而不是最终决策。

第二个模块是扩散变换器(DiT),专门负责生成最终的动作序列。它接收视觉语言模型处理过的信息缓存,加上机器人当前的关节状态,然后通过一种叫做"流匹配"的技术,从一片随机噪声出发,逐步生成精确的动作序列。这个过程就像雕刻家从一块毛坯大理石开始,一刀一刀削掉多余的部分,最终呈现出精准的雕塑。具体来说,推理时只需要5步迭代就能完成这个"雕刻"过程。

两个模块之间有一个细节处理值得关注:视觉语言模型生成的那些"候选动作方案",被特意屏蔽在扩散变换器的注意力范围之外。团队发现,如果让扩散变换器"看到"这些草稿,它会偷懒——直接复制视觉语言模型的结论,而不去认真地从视觉和语言信息中自己推导动作。这个"防止偷懒"的设计让最终的动作质量明显提升。

模型一共有三个尺寸:2B版本参数总量约26亿,5B版本约51亿,10B版本约105亿。不同尺寸分别对应不同的计算资源需求和性能水平,可以根据实际硬件条件选择。

五、越大越好:数据和模型规模带来的提升

研究团队用一系列严格的实验,验证了Xiaomi-Robotics-1在规模上是否真的"越大越好"。

在数据规模方面,他们用5B版本的模型,分别在12.5%、25%、50%和100%的约2万小时UMI数据上训练,然后在同一批留出的测试数据上评估动作预测的准确度(用均方误差衡量,数字越小越好)。结果非常清晰:随着数据量的增加,预测误差单调下降。特别是当数据只有12.5%和25%时,模型的误差曲线会先下降后上升——这是典型的"过拟合"现象,意思是数据太少,模型把那点数据记得太死,到新场景就不灵了。而当数据达到50%和100%时,误差曲线全程下降,且100%数据的下降速度更快,说明模型还没有"吃饱",继续加数据仍然能持续提升。

在模型规模方面,他们把2B、5B和10B三个版本都在同一批2万小时数据上训练,结果同样是规模越大、误差越小。不过一个有趣的现象是,三个尺寸之间的差距,比数据规模之间的差距要小。这说明在现阶段,数据量是更重要的瓶颈——模型已经足够大,但数据还不够多。

更关键的发现是:预训练阶段的规模效益,会直接传导到后训练阶段的实际表现。团队测试了一个极具挑战性的指标:在从未见过的新环境里,机器人不经过任何额外练习,直接完成任务(即"开箱即用")的成功率。结果显示,用100%预训练数据初始化的模型,开箱即用成功率达到75%;而没有经过任何UMI预训练、直接从Qwen3-VL权重开始的模型,成功率只有26%。仅仅用12.5%的预训练数据,成功率就直接翻倍到53%。在模型规模上,10B版本的开箱即用成功率达到79%,显著优于5B的75%和2B的61%。

六、四个任务的真机测试

团队设计了四个贴近真实家庭场景的任务,用来在真实机器人上测试开箱即用能力,而且测试环境和训练环境完全不同——不仅房间不一样,就连具体的物品也是从没见过的新款。

第一个是鞋子整理。机器人需要把一双黄色运动鞋拿起来,放到鞋架的指定位置。这个任务看似简单,但鞋子形状不规则、质地特殊,抓握需要相当精确的力度控制。

第二个是背包收拾。这个任务分成多个步骤:先拉开拉链,然后把一个小汽车模型放进去,再把一个红色罐头放进去,再放一个蓝色小包,最后把拉链拉上。这是一个多步骤、需要记住顺序的任务。

第三个是桌面整理。机器人需要把桌上的几件零散物品(太阳镜、牙膏、黄色固体胶、一个苹果)分别放到指定的容器和位置,同时还要遵从具体的语言指令(比如"把苹果放到木质托盘上")。

第四个是沙发整理。机器人需要把沙发上的红色毛绒玩具、小玩具车、白色衣物、黑色裤子分别放到收纳箱,并把一个靠垫放正。

在10B模型的开箱即用测试中,鞋子整理的成功率高达92%,背包收拾和桌面整理分别为75%和89%,沙发整理为77%。这些数字放在当前的机器人研究中属于相当高的水准,特别是考虑到测试环境和物品完全是模型从未见过的。

七、用极少的数据快速学会新任务

开箱即用能力验证了模型的通用性,但机器人还需要一个重要能力:用少量数据快速适应全新的、更复杂的任务。

团队设计了四个全新的、在整个训练数据集中从未出现过的任务,用来测试这种适应能力。

第一个是手机装箱。机器人需要用双手配合,把手机放进箱子,再把说明书放进去,然后盖上盖子。这个任务需要两只手的精细协调,难度较高。

第二个是衣物入洗衣机。这是一个移动操作任务,分为五步:打开洗衣机门、把装有衣物的篮子移到洗衣机门口、把衣服从篮子转移到洗衣机里、拿走篮子、关上洗衣机门。整个流程跨越较大空间,需要多步骤记忆和执行。

第三个是打印机加纸。机器人需要抓取一叠纸,把它递给另一只手(双手交接),然后把纸的一端塞进打印机纸盒,再把整叠纸完全推入,最后把两只手臂归位。纸张是高度柔软易变形的材料,操控难度极大。

第四个是箱子收纳。机器人需要根据语言指令,把桌上的多个指定物品依次放进箱子,考验的是语言理解和物品识别能力。

测试分两种数据量:低数据设定每个任务平均不到10小时的训练数据,高数据设定总计144小时。对比的基准是两个同类顶级系统:π0.5(Physical Intelligence公司开发)和Xiaomi-Robotics-0(小米上一代系统)。

在低数据设定下,Xiaomi-Robotics-1的平均成功率达到75%,远超π0.5的40%;高数据设定下,这个优势进一步拉大,平均成功率达到85%。在打印机加纸这个最难的任务上,Xiaomi-Robotics-1在低数据设定下成功率达到70%,而最好的对比方法只有20%——差距是3.5倍。在衣物入洗衣机任务上,π0.5因为经常卡在"打开洗衣机门"这一步而失败,Xiaomi-Robotics-0在低数据设定下根本无法完成全流程,而Xiaomi-Robotics-1在低数据设定下就达到了80%的成功率和96%的进度得分(进度得分衡量的是"虽然没完成,但做到了哪一步")。

八、四大模拟基准测试的全面领先

除了真机测试,团队还在四个权威的模拟测试平台上进行了评估,与当前最顶尖的系统进行了横向比较。

RoboCasa是一个模拟厨房环境的基准,包含24种日常厨房任务,测试时使用的是训练中从未出现过的物品款式和部分全新的厨房风格。Xiaomi-Robotics-1在这个基准上的平均成功率达到74.5%,超过了之前最好的World2Act系统(72.6%),也超过了NVIDIA的GR00T N1.6(66.2%)。

RoboCasa365是RoboCasa的升级版,把任务数量从24种扩展到365种,场景超过2500个,物品超过3200种,还特别设计了"从未见过的复合任务"评测——也就是把模型以前学过的简单技能组合成新的复杂任务,考验真正的泛化能力。Xiaomi-Robotics-1在总平均成功率上达到57.4%,比之前最好的ABot-M0.6系统(46.6%)高出了10.8个百分点。在最难的"未见复合任务"分项上,Xiaomi-Robotics-1达到32.1%,而ABot-M0.6只有7.9%——差距接近4倍,说明Xiaomi-Robotics-1具备了将已学技能灵活重组的能力。

VLABench是一个更加注重语言理解和泛化的基准,包含100种任务类别和超过2000个物品,特别设计了多种"分布偏移"测试:指令中包含隐含的人类意图、跨类别物品迁移、常识推理、以及材质和外观的变化。在这个基准上,Xiaomi-Robotics-1的平均成功率达到59.1%,明显超过ERVLA(53.2%)和π0.5(48.1%)。特别值得一提的是材质变化测试,也就是相同物品换了颜色或纹理后机器人还认不认得——Xiaomi-Robotics-1的成功率达到62.6%,比最好的对比方法高出15.2个百分点,展现了极强的视觉鲁棒性。

RoboDojo是目前最全面的综合评测基准之一,包含超过42种模拟任务,覆盖五个维度:泛化能力(换物品换场景还能做吗)、精度(精细操控)、长时序(多步连续操作)、记忆(需要记住之前状态)、开放(理解开放性语言指令)。Xiaomi-Robotics-1的总平均得分为20.07,而之前最好的Hy-Embodied-0.5-VLA只有13.07;平均成功率为13.93%,而前者为8.80%。在五个维度中,Xiaomi-Robotics-1在泛化、精度、长时序、开放四个维度均排名第一,只有记忆维度略低于Hy-Embodied-0.5-VLA——因为后者专门在设计上加入了历史观测记忆机制,而Xiaomi-Robotics-1在RoboDojo测试中完全没有使用历史观测信息。

说到底,Xiaomi-Robotics-1这个系统的意义,不仅仅在于它在各种测试上拿了第一。更深远的价值在于,它系统地验证了一件之前在机器人领域存在很大不确定性的事情:规模真的有效。在大语言模型领域,大家已经接受了"数据越多、模型越大、性能越好"的规律;但在机器人领域,因为数据收集太难,这个规律一直没有被充分验证。小米团队的这项工作,用10万小时的数据和从2B到10B的模型对比实验,给出了一个相对清晰的答案:机器人也遵循同样的规律,而且预训练阶段的规模效益会直接传递到真实机器人的实际操控表现。

这对整个行业的启示在于,收集真实、多样、大规模的操作数据,可能是机器人走向通用化最值得投入的方向之一,而不是不断设计更聪明的算法来弥补数据的不足。当然,这项研究也存在一些尚未解决的问题:在记忆型任务上的短板、在完全开放式指令下的表现仍有提升空间,而且目前的测试主要集中在家庭室内场景,户外或工业场景的表现还有待进一步验证。

对于普通人来说,这项研究可能距离你家里真正出现一个能帮你叠衣服、收拾书包的机器人,还有相当一段距离。但它让这个距离变得更短了一些,也让这件事变得更加可期。有兴趣深入了解的读者,可以通过arXiv:2607.15330查阅完整论文,小米团队也承诺会开放代码和模型权重。

Q&A

Q1:Xiaomi-Robotics-1和普通机器人有什么不同?

A:普通机器人通常只会在特定环境执行固定任务,换个场景就失灵了。Xiaomi-Robotics-1经过10万小时真实操作数据训练,能在从未见过的新环境里直接完成任务,还能用极少数据快速学会全新任务,灵活性远超传统方案。

Q2:UMI装置是什么,为什么用它来收集数据?

A:UMI是一种手持抓夹装置,人拿着它操作物体时,装置会自动记录手的动作轨迹。它的优势是不需要真正的机器人在场,普通人就能在家、在餐厅、在户外随时随地收集数据,成本低、场景多样、可大规模部署,解决了机器人数据收集既贵又慢的核心难题。

Q3:Xiaomi-Robotics-1目前能在真实家庭里用吗?

A:目前还处于研究阶段,还不是可以直接买到家里用的消费级产品。但真机测试显示它在鞋子整理、桌面整理等家庭任务上成功率已达75%到92%,研究团队也计划开放代码和模型,未来商业化落地的路径正在逐步清晰。