henry 发自 凹非寺
量子位 | 公众号 QbitAI

今年5月,英伟达机器人负责人Jim Fan在一场公开演讲中宣告:VLA、遥操已死。

当时,绝大多数人听到的第一反应都是:从来不缺暴论的AI圈,又多了一条新暴论。

但没想到,几个月后,这句当时听起来有点夸张的话,居然真的开始照进现实。

刚刚,自变量发布全新灵巧操作系统TwinDex。在后训练阶段真机遥操数据为0的情况下,机器人连续完成了化学实验场景中,旋拧瓶盖、注射器推注等多项精细操作。

要知道,以往想让机器人学会这类精细操作,还真少不了真机遥操数据来“手把手”教学。

但TwinDex这次,直接把这部分数据需求给砍没了,取而代之的是区区几百条无本体数据,机器人含量几乎为0~

这是怎么做到的?

遥操,可能真的危险了

俗话说,好的Demo,值得细细品鉴。

TwinDEX这次放出的Demo里,最完整的一段,是一套一镜到底的化学实验:

从开瓶取样、滴管与试管操作,到玻璃棒引流、摇匀观察,全程由策略自主执行。

整个实验包含24个子动作,跨越三种工具,涉及多次双手协调与工具切换,每一步都要求毫米级定位与稳定力控。

而拆开来看,TwinDEX这三根手指,实际上集中展示了几类过去灵巧操作里最难啃的能力。

首先,是对精度要求极高的精细操作

在打开工具箱时,机器人需要让左右两根食指同时对准两个狭窄卡扣,准确插入后向下拨开,再用食指和拇指捏住提手,把箱盖打开。

打开网易新闻 查看精彩图片

这里的难度在于,机器人的手能不能准确进入一个容差很小的空间,从而完成操作。

同理,注射器推注也是类似。

打开网易新闻 查看精彩图片

食指和中指固定筒身,拇指对准推杆向前发力,既要保证位置不跑,又要精确控制推注方向和力度。

随着具身智能逐步走进实验室、工厂和家庭,这类小容差、高精度、强接触的操作,也会越来越接近机器人的基本功。

第二,是三指协作

比如在扫帚和簸箕任务中,三根手指围绕手柄形成包络,让不同手指共同承担支撑和控制。

打开网易新闻 查看精彩图片

相比只有两根手指,第三根手指多提供了一个接触点,也多了一种稳定物体的方式。

尤其是在工具使用、长条物体抓持这类任务里,这个额外的支撑点相当关键。

第三类,则是更接近人手的柔性操作和掌内调整

在拧开瓶盖时,TwinDEX用食指和拇指捏住瓶盖,再靠手指自身的侧摆完成旋转,几乎不用大幅转动手腕。

打开网易新闻 查看精彩图片

而在翻书中,机器人的拇指则先把最上层书本搓出来,再完成捏取、双手交接、放置和翻页。

我个人看完这一圈,一个很直观的感受就是:

以往在处理这类动作时,大家往往会下意识想到结构更复杂的五指灵巧手,以及庞大的真机遥操作数据。

但上面的Demo恰恰说明了一件事:很多过去被认为需要五指完成的精细操作,三根手指其实已经够用了。

而且某种程度上,这三根手指头,已经比不少五指灵巧手玩得还溜。

不过,前面这些其实只是TwinDEX站在台前、作为机器人执行器的一面。

而在机器人真正上手干活之前,它还有另一重身份,一套与执行端匹配的可穿戴无本体数据采集系统。

打开网易新闻 查看精彩图片

相比很多在数据采集和机器人执行阶段使用两套不同硬件的方案,TwinDEX直接采用了数采与执行同构的设计。

说人话就是,这三根手指不光负责干活,采数据也用的是同一套结构,也就是所谓的“所采即所得”

采集员在采集端做出的动作,可以更直接地映射到机器人执行端,中间不用再跨一套完全不同的硬件去做复杂的数据迁移。

也正因为如此,前面那些对指尖位置和力度都要求极高的精细操作,才能更稳定地被机器人做出来。

与此同时,相比直接遥操一台笨重的机器人,采集员可以更自然、更快速地完成动作,数据也更好采,也更省钱。

实验结果也确实验证了这两点。

采集效率方面。TwinDEX单位时间能够产出的有效轨迹,约为传统真机遥操的5.3倍

打开网易新闻 查看精彩图片

同样一个采集员、同样一段时间,TwinDEX能够更快地攒出一批真正可用于训练的数据。

而在数据利用效率方面,自变量则发现:

随着数据量增加,无本体数据和真机遥操作数据训练出的策略,会以相同的速率持续提升,并最终收敛到接近的表现。

打开网易新闻 查看精彩图片

换句话说,在这组实验中,训练模型时,无本体数据近乎可以100%替代真机遥操作数据。

所以,作为数据采集器,TwinDEX解决的并不只是“怎么把数据采得更快”。

更关键的是,它在提高采集效率的同时,也尽可能减少了这些数据真正迁移到机器人身上时的精度损失。

而这两件事,最后都指向了同一个问题:

怎么让无本体数据真正变成机器人能用的数据。

TwinDEX:让具身数据提前对齐

严格来说,TwinDEX其实并不只是一套三指灵巧手。

它更像是一套由数据采集硬件、机器人末端执行器、数据处理管线和模型训练流程共同组成的灵巧操作系统。

而且,并不是简单让数据采集端和机器人执行端长得一样,就能自然完成数据迁移。

TwinDEX真正关键的地方,是从只依赖无本体数据完成后训练、去掉真机遥操作数据这个目标出发,再反过来设计整套系统。

打开网易新闻 查看精彩图片

从灵巧手的构型、采集设备的运动方式,到视觉观测、时间同步、数据处理,再到最终的模型训练,实际上都在围绕同一个问题展开:

怎样让采集出来的数据,从一开始就尽可能接近机器人真正需要的数据。

理解了这一点,我们接下来看TwinDEX最直观的硬件部分。

从实际Demo里的功能分工来看,拇指和食指承担了大量对掌、捏取、旋拧和精细操作,第三根手指则能够进一步提供包络、支撑和稳定。

打开网易新闻 查看精彩图片

整套TwinDEX的设计,可以概括成三个特性:灵巧性、一致性和可扩展性

打开网易新闻 查看精彩图片

第一个,是前面已经反复出现的灵巧性。

TwinDEX既没有选择UMI一类常见的两指夹爪,也没有照着人手一路堆到五指,而是在灵巧性、稳定性和工程复杂度之间取了一个折中。

众所周知,手指越多、结构越接近人手,理论上的灵巧操作上限当然越高。

但与此同时,增加的还有更多关节、驱动器、传感器,以及随之而来的标定、控制和维护成本。

反过来,两指夹爪虽然足够简单,却很难覆盖旋拧、掌内调整、多点接触等精细操作。

打开网易新闻 查看精彩图片

因此,在经过基础抓取、原地旋拧、工具使用和掌内操作等元操作测试,并与多种候选构型对比后,自变量最终发现:

三指九自由度,就是目前的甜蜜点,它可以用相对可控的复杂度,覆盖当前大多数任务真正需要的灵巧能力。

第二个,也是TwinDEX最关键的设计思路,一致性。

这里的一致性,是指TwinDEX的数据采集端和最终执行端运动方式接触方式视觉观测采集精度时间同步上,都尽可能保持一致。

这也是TwinDEX能够减少真机遥操数据需求的关键。

过去,很多无本体数据虽然好采,但真正迁移到机器人身上时,往往会遇到一个问题:采集端和执行端并不是同一套本体

人的手怎么动、采集设备怎么记录,到了真正的机器人上,不一定能原样复现,中间通常都会存在运动学差异和精度损失。

所以,这类数据虽然容易Scaling,却很难直接拿来训练目标机器人。很多时候,最后还是得再补一批真机遥操数据,完成本体对齐和后训练。

打开网易新闻 查看精彩图片

TwinDEX的一致性设计,想解决的正是这一步。

它没有等数据采完之后,再想办法让数据去适配机器人,而是在硬件设计阶段,就让采集端和执行端尽可能同构。

也就是说,不再等数据采完之后,再想办法让它适配机器人,而是在设计采集设备和灵巧手时,就先把两边尽可能对齐。

换句话说,把原本发生在数据处理阶段的“本体对齐”,提前到了数据产生之前。

这样一来,无本体数据迁移到机器人身上时的损耗就能被尽可能压低,也就减少了额外补充真机遥操数据的需求。

也正因为如此,在这次实验覆盖的任务里,TwinDEX才能在不新增目标机器人真机遥操示范的情况下,直接用几百条无本体数据完成后训练,并做出前面那些精细操作。

第三个特性,则是可扩展性。

TwinDEX的数据采集端是一套可穿戴的三指外骨骼。

它最大的好处在于,采数据不需要占着一台真实机器人,也不需要围着固定工位来做。

打开网易新闻 查看精彩图片

操作员戴上设备,就可以直接完成旋拧、按压、工具使用等动作。

相比隔着控制器遥操机器人,这种方式也更接近人的自然操作:手可以直接接触物体,获得真实的力反馈,不需要额外适应空间映射和通信延迟。

更重要的是,数据采集不再和机器人数量一一绑定。多名操作员可以在不同地点同时采集,再把数据统一汇总到同一套处理和训练管线中。

打开网易新闻 查看精彩图片

在采集过程中,系统会同步记录视觉、关节状态、手腕位姿等多模态信息,再通过标定、时间同步和标准化处理,把来自不同操作员、不同地点的数据整理到统一的训练空间里。

不过,规模一旦扩大,新的问题也会随之出现。

不同设备、不同操作员在采集过程中,不可避免会带来抖动、漂移和定位误差。

因此,自变量也在模型架构和训练流程里做了相应设计,让模型能够容忍一定范围内的采集误差,并最终把这些数据学习成机器人可以闭环执行的策略。

到这里,TwinDEX的三条设计逻辑也就明朗起来了:

灵巧性决定它能采什么、做什么;一致性决定采来的无本体数据能不能顺利迁移到机器人身上;而可扩展性,则决定这套采集方式能不能真正Scaling。

数据金字塔的塔尖正在被磨平

所以,TwinDEX真正值得关注的,不只是“数据采得更快”,它进一步证明了一件事:最接近机器人动作的高质量数据,未必只能由真实机器人生产。

过去两年,遥操真机数据一直站在具身数据金字塔的塔尖。

△AI生成

它质量最高,因为视觉、关节状态、末端轨迹天然对齐;但代价也最大——

每采一条数据,都必须真实占用一台机器人。

与此同时,机器人要部署、维护,人也要学习遥操,机器人数量一旦成为数据产能的上限,想真正Scaling就变得非常困难。

这也是Jim Fan说遥操已死的背景之一。

打开网易新闻 查看精彩图片

出于此,整个具身社区这两年都在探索UMI、手套/外骨骼、Ego第一视角等新的数据采集策略。

它们的核心思想,也都是想用更容易扩展的无本体数据,降低对真机数据的依赖。

但这里一直存在一个两难。

采集方式越自由,数据越容易Scaling;可采集端离真实机器人越远,后续的映射和迁移难度也越大。

尤其是人手与机器人在结构、自由度和接触方式上的差异,会不断引入动作重定向和精度损失。

而TwinDEX这次做的,就是在可扩展性数据保留的物理信息丰富程度之间找到了一个新的甜蜜点。

它没有彻底放弃机器人本体带来的约束,而是把机器人真正需要的动作结构,提前“复制”到了数据采集端。

因此,在已经展示的任务中,只需要几百条无本体数据,就完成了过去后训练阶段通常需要真机遥操数据承担的一部分对齐工作。

当然,客观来说,在具身数据recipe还远没有收敛的今天,考虑到任务覆盖和数据多样性的需求,我们还不能直接宣布“遥操已死”。

但至少有一点已经越来越明确:

高质量数据与真机遥操之间的强绑定,正在松动。

如果无本体数据在后训练阶段,能够逐渐获得接近真机数据的训练价值,那么接下来真正值得探索的,就是一条属于无本体数据的Scaling Law

只不过,在把无本体数据规模做大、真正验证这条Scaling Law之前,自变量已经率先在当前这个时间节点给出了自己的答案:

每扩展到一个新任务,都必须从真机遥操数据开始的时代,正在结束。

项目主页:https://x2robot.com/pages/twindex