我已经被机器人刷屏一周了。
机器人刷新了人类百米纪录、「原地起飞」近三米、「害羞跑」的姿势火到海外、赛博张三丰腾空外摆 540°…….
今年的世界人形机器人运动会更热闹了,来自六大洲 16 个国家的 666 支队伍,带着 2056 台机器人来到北京,比赛也从田径、武术等项目,一路延伸到家庭、酒店、工业和应急救援等真实场景。
不过机器人在赛场上的翻车,大家笑笑就过去了。而机器人真正进入家庭后,可能就是打翻水杯、撞倒家具,或者把刚收好的衣服重新扯到地上,那就笑不出来了。
真实的世界里没有固定的跑道和统一摆放的道具,杯子被人挪了一点,桌面多出一块抹布,原本训练好的动作就可能失效。
把机器人这些试错搬进虚拟世界,正是当下世界模型想做的事。它试图还原一个符合物理规律的环境,让机器人真正在动手前先预演:手往左偏一点会不会抓空,夹爪提前闭合会不会碰倒杯子。
但实际上不少世界模型无法实现可靠的「虚拟测试」。它们可能看懂了画面,却没有真正听从动作。推演时间一长,物体和位置开始漂移。虚拟世界里表现更好的策略,到了真机上也未必奏效。
就在机器人开始从竞技场走向真实场景时,自变量机器人发布了自回归世界模型 WALL-SS。
WALL-SS 构建的这座「虚拟训练场」终于突破了世界模型的瓶颈,动作能否真正改变结果,长任务中能否保持连贯,虚拟成绩能否经得起真机检验,都有了新的解法和答案。
它可以推演持续60秒的倒水和物品整理任务,来测试不同动作的结果:按照不同的方式抓水杯,是抓空、碰倒水杯,还是成功抓起?
研究团队还把多套机器人策略分别放进 WALL-SS 和真实世界测试,在虚拟世界里执行效果很好的动作策略,搬到物理世界往往也有好的结果。
这就有意思了,机器人做的「梦」,开始能够用来练习和筛选真实动作。
相关
项目主页:
http://x2robot.com/pages/ss
论文链接:
https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf
Github 链接:
https://github.com/X-Square-Robot/wall-ss
机器人「做梦」的方式,会决定现实里是否翻车
世界模型是目前具身智能最受关注的方向之一。
它可以理解成机器人脑中的预演系统。给它当前画面和一组准备执行的动作,它会预测接下来会发生什么。
机械臂向左移动 1 厘米,杯子会被抓住还是被碰倒?抽屉已经打开,下一步应该继续取东西,还是先调整手腕角度?机器人可以比较多个未来,再决定采用哪条动作路径。
机器人公司也可以把不同版本的动作策略放进世界模型测试。表现更好的版本再上真机,省下在真实世界测试动作效果的昂贵成本。
问题是,很多世界模型很多时候更像一位过分乐观的导演。
机器人训练数据通常以成功示范为主。如果模型看到的大部分夹爪闭合动作,后面都跟着物体被拿起,它就容易走捷径:只要夹爪闭合,物体就应该被抓起来。
即使夹爪与物体之间还有明显空隙,生成画面里的物体也可能主动贴进夹爪。论文把这类现象称为类似「磁铁式抓取」的错误。
这类偏差在跑步、跳舞等大动作里未必显眼,到了精细操作中却会直接决定成败。夹爪与杯把差几毫米,机器人可能抓空。插头角度偏了一点,也很难顺利插入接口。
机器人从「会做」走到「做成」,往往就卡在最后几毫米。
世界模型如果直接把这几毫米抹平,给出的未来越流畅,机器人越容易高估一套动作的可靠性。
推演时间一长,还会出现新的麻烦。
世界模型生成完一段画面后,还要把它作为下一段预测的依据。前面一点小误差,会在后续不断累积。物体可能慢慢偏离原位,夹爪与杯子的接触关系也会发生变化。
只保留最近几帧,模型会忘记之前做过什么,但要是保留全部历史,计算量和显存占用又会持续增长。
视频看起来逼真,不代表模型选出的策略真的更好。机器人研发需要知道,虚拟测试里的优胜者,到了真机上能不能继续领先。
世界模型需要让不同动作确实通向不同结果,流畅画面只完成了最表面的一步。
机器人怎么动,未来就该怎么变
WALL-SS 预测接下来几秒的画面时,会先搭出一版「低清预览」。
在这版预览里,模型先确定大方向:机械臂往哪里走,物体大概会怎么移动。随后,它把同一段画面一层层调清,补上物体轮廓、夹爪开合和接触位置。
论文把这种从大轮廓到小细节的层级叫做「尺度」。已经生成的画面和发生过的动作,会成为下一段预测的历史,这就是「下一尺度自回归」。
画面每清晰一些,动作也会再影响一次未来。
手臂往左还是往右,会先改变低清画面里的运动方向。夹爪何时闭合,会继续影响清晰画面里有没有碰到杯子。
一小段未来生成完成后,它会连同已经发生的动作一起进入记忆,成为模型继续往后推演的依据。
过去一些世界模型更像在开拍前看一眼动作要求,但后面它还是容易依赖任务描述和视觉经验,把剩下的剧情把剧情自己脑补出来。
WALL-SS 把动作和画面放在同一条时间线上。哪只夹爪在什么时候移动到哪里,头部相机和腕部相机应该看到什么变化,都要相互对得上。
同一张初始画面配上不同动作后,模型会生成不同未来。夹爪偏离物体时,它需要表现抓空。路径碰到障碍物时,它也不能直接跳到任务成功的结局。
结果怎么验证呢,WALL-SS 会固定初始画面,只换一条动作轨迹,看未来有没有跟着改变。模型如果只改变画面细节、始终生成同一个成功结局,很难在这项测试中获得高分。
WALL-SS 在这项评测中得到 0.290,Cosmos3 为 0.044,其他模型则是0分。这项指标衡量模型对动作变化的敏感程度。两者之间的差距表明,WALL-SS 更愿意按照输入动作改变后续画面。
模型愿意随着动作改变画面还不够。生成画面里的机械臂,也要真正走在给定路线上。
在衡量这件事的「轨迹精度」上,WALL-SS 得到 0.539,是全部对比模型中的最高分。它的视觉骨干 InfinityStar 得分为 0.251。换成人话,虚拟机械臂既「听见」了动作指令,也更能沿着指令指定的路线移动。
▲固定初始画面,只改变动作条件,三组分支会生成不同轨迹和不同未来。蓝线是给定动作,橙线是生成画面中实际出现的轨迹.
这些能力也来自一批过去容易被丢掉的数据。
研究团队保留了抓空、滑落、碰撞、重新抓取、人工接管和失败恢复等过程。其中一种采集方式,是先保留机器人发生错误的动作,再回到接近出错前的状态,由操作员执行一套纠正动作。
如果训练数据里没有失败,世界模型很容易把「任务目标」误当成「必然结局」。
做一分钟家务,机器人怎么才能不「断片」
上面说的这些,只能保证机器人没有从第一步开始跑偏。
而家庭任务往往包含多个连续步骤,打开抽屉、拿起物品、放进抽屉、再把抽屉关上,可能持续几十秒。机器人还要记住抽屉是否已经打开,物品目前在桌面还是手里。
WALL-SS 没有让模型把每一帧都永远背下来。它会让记忆随着时间自动变得“模糊”。
刚刚发生的动作保留更多细节:机器人几秒前有没有碰到杯子,夹爪是否已经闭合,都需要精确记住。
更早的历史会被压缩。模型不必一直保存几十秒前每一帧的细节,只要记住桌上有哪些物体、它们大致在哪里、任务已经进行到哪一步。
最初的观察画面会被保留下来,作为场景和物体身份的锚点。视觉历史被压缩时,对应的动作历史也会一起压缩。
这就是「尺度压缩的长时间跨度记忆」,它像一份会自动整理的工作记录,刚刚发生的事情才保留详尽细节,更久以前的事情只留下摘要。
模型不需要记住过去的每个像素,它只要了解哪些变化还会影响下一步。
即便如此,预测画面的过程中仍不可避免地积累小的误差。机器人需要学会自己纠正误差。为此 WALL-SS 拿出了「逐尺度梦境强迫」的大招。训练时,研究团队会给历史信息加入扰动,要求基于有误差的信息,预测正确的未来。
这相当于让机器人平时就在「有小错误的梦」里继续往下走,学会别把一个小错滚成整段任务崩溃。
在长时测试中,WALL-SS 连续推演了 60 秒,轨迹误差、片段衔接、物体状态和视觉质量,都比对照模型更稳定。
其中倒水任务包含接近水瓶、抓握、抬起、倾倒和放回等阶段。在 60 秒推演中,机械臂逐帧轨迹误差保持在画面对角线的 0.5% 以下。
▲上方记录从接近水瓶、抓取、倒水到放回的连续过程,下方比较生成轨迹与给定轨迹
只保留最近片段的版本,在 20 至 30 秒后开始明显恶化。去掉梦境强迫后,长期状态一致性也会持续下降。
这就能验证一项持续 1 分钟的操作里,机器人仍能记得自己做过什么,能够稳定地推演未来。
虚拟成绩,能不能替真机筛策略
不过就算动作对了,记忆也没断片,虚拟世界仍然可能和现实存在偏差。
你想如果一个机师只做过模拟飞行,你敢坐他的飞机吗?
而 WALL-SS 则想了一个办法,是给自己的预测安排两位长期在线的「裁判」。
在相同动作条件下,模型会生成多条未来支线。一个裁判会检查动作,比如画面里的机械臂是否按照给定方向移动,物体是否产生了对应变化。
另一个裁判负责审核长期一致性,看机器人和物体的状态有没有漂移,前后片段能否接上,多个摄像头看到的世界是否一致。
最后模型会根据评分调整下一次生成不同未来的概率,这套过程叫「视觉动力学的在线策略对齐」。
简单来说就是用来专门优化视觉世界的变化规律。机器人控制器不会收到任务成功率奖励。参考模型约束和真实轨迹回放也会同时加入,防止模型为了获得高分而牺牲原有画面质量。
对齐之后,动作跟随从 0.264 提升至 0.290,轨迹精度从 0.512 提升至 0.539,跨片段边界误差从 0.118 降至 0.104。动作与轨迹更贴近指令,前后视频也更容易接上,画面质量基本没有变化。
我们直接看看论文里虚拟测试和真机测试的对比。
研究团队选取 5 个不同训练阶段的 WALL-WM 策略,在 6 项任务、20 组匹配初始状态下,分别进入 WALL-SS 和真实机器人执行,共得到 600 对闭环结果。
600 对实验中,有 527 对的最终成败一致。WALL-SS 在虚拟世界里选出的较好版本,有 89% 的优劣关系与真机测试相同。
如果把 30 个「任务与策略版本」组合的成功率放在一起比较,虚拟结果和真机结果的相关系数为 0.926,平均绝对误差为 0.062。
这个 0.926 衡量虚拟与真实结果的整体变化趋势,不能理解成单次预测有 92.6% 的命中率。
▲左图比较虚拟与真机成功率,数据越接近对角线,代表两者越一致。右图比较 6 项任务中 5 个策略版本的虚拟与真机成.
世界模型无需彻底取代真机测试,它只要能先筛掉较差的版本,就已经可以省下大量现实试错。
WALL-SS 还在同一套系统中加入了动作专家。
外部动作给定时,视觉生成器负责预测「这样做会发生什么」。需要模型自主行动时,动作专家可以根据当前状态生成下一段控制指令。两个部分共享已经确认的世界状态和动作接口。
动作专家可以直接控制真实机器人。在论文的桌面双臂任务中,WALL-SS 的平均任务进度得分为 69.1。作为对比,π 0.5 为 49.6,DreamZero 为 44.1,LingBot-VA 为 34.0。
模拟器负责预演,动作专家负责执行。两者在同一份世界状态上来回接力,形成「提出动作—预演结果—继续行动」的闭环。
WALL-SS 主要作用在机器人认知和训练这一侧:怎样预演动作、记住长任务、评测策略。真正拧紧一颗螺丝、把插头稳定送进接口,还依赖关节精度、灵巧手、触觉和力控。
世界模型可以提前发现哪条动作更可能失败,也能减少较差策略直接上真机的次数。末端执行器能否稳定落位,仍取决于整套软硬件的配合。
具身智能的「ChatGPT 时刻」,看谁能更快走进现实
前几年,人们还在关注机器人能不能站稳、跑起来。今年的赛场开始把衣物整理、家庭清洁、酒店服务和应急救援放进长流程任务。
当机器人从舞台演示走向真实服务,行业判断技术的方式也会改变。一个成功 Demo 只是一张入场券。机器人能否重复完成任务,换个环境是否还能工作,模型每次更新要花多少真机成本,都会变得更重要。
下一轮具身智能竞争,会看谁能让机器人学得更便宜、测得更可靠,并走进更多陌生环境。
WALL-SS 给我们提供了一种具体的解法:动作必须真正改变预测结果,长任务中不能轻易失忆,虚拟策略排名还要接受真机验证。
当世界模型能预测真机策略的相对优劣,它就开始从内容生成能力变成研发系统的一部分。
这会改变世界模型在机器人公司里的位置。失败和纠正数据先帮助模型认识现实的边界。随后,虚拟环境批量筛选策略,少量真机结果再回来检查和修正这个虚拟世界。
虚拟训练场由此兼任练习场、考场和校准台。真机数量决定数据入口,每一小时真机数据能换来多少轮模型迭代,也会影响研发速度。
真机需要占用设备、布置场景,还要有人处理失败后的复位。涉及碰撞、液体或易碎物品时,测试本身也有风险。
世界模型可以先承担大规模初筛。真机只需要验证虚拟考场里更有希望的候选策略。
这有点像汽车碰撞仿真。它不会取消最后的实车测试,却能减少为了筛选设计而撞掉的真车。
世界模型与 VLA 可以分工协作。VLA 负责根据视觉和语言生成动作,世界模型负责提前演一遍「这样做会发生什么」。一个负责出主意,一个负责看后果。
真机产生的成功、失败和人工接管数据,还能继续回流。世界模型变得更准后,又可以测试更多策略,再把更好的版本送回真机。
前段时间,自变量在一次物流分拣直播中,让搭载 WALL-B 的双臂机器人使用标准夹爪,处理纸箱、软袋、圆柱形快件和泡沫封装生鲜件等随机包裹。它完成了 1911 件有效分拣,准确率超过 98%。
以后 WALL-SS 会让机器人走向工位之前准备更充分,它先在虚拟世界里检查它会不会抓空、碰撞,或者在连续作业中逐渐跑偏。对按吞吐量和停机时间计算成本的仓库,这类虚拟筛选有机会减少设备占用和现场复位。
这样一来,用户或者企业就可以尽量避免成为最早一轮试错的「小白鼠」,倒水、递物和收纳等动作,也有机会在执行前先比较不同后果。
王兴兴最近谈到他理解的具身智能「ChatGPT 时刻」:机器人能够在约 80% 的陌生场景中,只靠语言或文字指令,完成约 80% 的任务。对于这个时刻,他判断快则 2 至 3 年,慢则 5 年甚至 10 年。
当然 WALL-SS 还没有把机器人直接带到这个阶段,这篇论文的真机实验主要集中在桌面双臂任务,验证的连续推演时长为 60 秒,但自变量至少提供了一个抵达「ChatGPT 时刻」更现实的方向。
等到机器人真正走进家门,少摔一次杯子,比多拿一块金牌要重要得多。
热门跟贴