触觉正在变成下一代具身智能的基础能力。
过去两年,机器人行业把大量资源投向本体、大模型、灵巧手和视觉能力。随着这些能力快速进步,瓶颈越来越集中在接触环节:机器人既要找到物体,也要在抓取、插拔、装配和柔性操作中感知受力、摩擦、滑移与形变。
8月10日,戴盟机器人发布触觉锚定世界模型Daimon-TWM。就在一天后,又完成数亿元战略融资。这也是戴盟两个月内拿到的第二笔亿元级融资。
这些动作集中出现,指向了同一个变化:触觉正在从指尖走向全身,也开始进入机器人的模型层。
最近,帕西尼推出足底多维触觉传感器PX-FOOTRIX;7月,1X发布的新一代NEO灵巧手,在指尖和手掌表面加入触觉皮肤;波士顿动力Atlas、Figure 03也把触觉列入新一代机器人的基础配置。
至少对头部机器人公司来说,要不要触觉已经不再是问题。竞争正在转向:触觉能否从硬件信号进入模型,成为机器人理解和操作物理世界的底层变量。
戴盟真正值得关注的,是把视触觉传感器、原生触觉数据、VTLA和Daimon-TWM接成了一条路线。它想做的,是让模型学会理解、预测并利用触觉。
01
从感知接触,到预测动作后果
在今年的WAIC上,戴盟展台上有两组操作,也吸引了我的关注。
一组是水果装盒。机器人要控制力度,拿起容易受损的水果,再完成摆放和盒盖扣合。另一组是整理笔袋,包括拉开拉链、放入文具和重新闭合。相比刚性物体,笔袋会变形,拉链阻力也在不断变化。
我在现场也测试了笔袋整理。在机器人干活的过程中,我在桌上多放了一个马克笔。它稍微停顿了下,重新判断笔袋里的空间,调整动作后继续收纳。
在我看来,这个停顿非常有价值。因为在真实的工厂和家庭里,物品的位置、软硬程度和摩擦力不是完全固定的。机器人除了完成抓取,还得判断接触过程中物体发生了什么临时变化。
以机器人进厂中最常见的USB插拔为例,插头接近接口后,关键接触位置会被遮挡。摄像头很难判断它是已经对正,还是顶偏、卡住。人可以根据“手感”变化完成最后的对位和插入。但常规的VLA模型却往往先生成一段动作,再按动作块执行。中途出现滑移、碰撞和卡滞,小偏差很快就会积累。
Daimon-TWM做的,是让触觉进入理解、预测和控制的主链路。模型先判断当前接触状态,再推演继续动作可能发生什么,最后用100Hz高频控制随时修正。插头可能卡偏,就先回撤;物体出现滑移趋势,手指马上改变力度。
这也是触觉发展的一个关键节点。
早期触觉解决“有没有碰到”,后来进入反馈控制,解决“用了多大力”。触觉锚定世界模型再往前一步:机器人开始根据接触信息,预测自己的动作会造成什么后果。
触觉的竞争也由此变了。过去主要比传感器的精度、频率和耐久性,接下来还要比谁能把触觉变成模型能力。触觉由末端信号进入认知和决策系统,才真正有机会成为机器人大脑的一部分。
戴盟参与发表的UniTacVLA论文测试了调整、擦拭、插入和装配等八项任务。在无扰动环境下,模型平均成功率为64%,加入人为扰动后约为53%;对照模型π0.5分别约为26%和6%。消融实验还显示,单纯增加触觉输入的提升有限,理解接触状态、预测未来触觉,再配合高频纠偏,成功率才明显提高。
这个结果也指出了一条很重要的路:此前的具身模型主要从视频中学习“人怎么做”,触觉世界模型开始学习人为什么在这里减速、换角度,以及碰到阻力后为什么没有继续硬推。
机器人由模仿动作走向理解动作的物理后果,Daimon-TWM的价值应该放在这个坐标里看。
02
触觉还没有通用语,模型已经开始选路线
目前,机器人触觉还没有统一的技术路线。压阻、电容适合大面积铺设,霍尔和磁阵列擅长测量多维力,视触觉则通过相机观察柔性材料的形变,读取接触位置、受力和纹理。我的判断是,未来机器人不会只押注一种触觉路线。
但从与大模型的适配程度看,视触觉是目前最好的选择。
原因是它产生的图像和形变场,恰好是现有AI最熟悉的数据。计算机视觉积累多年的编码器、训练框架和数据工具,大部分可以直接迁移。Meta的通用触觉表征Sparsh使用超过46万张视触觉图像训练,戴盟走的也是这条路。
视触觉的优势是数据形态更接近图像,难点则在于,触觉图像、形变、剪切、深度和力等不同模态,如何被同一个模型理解和使用。
戴盟提出“统一触觉词元”,首先解决的是这个问题:把不同触觉模态转成模型能够理解的token,并让触觉贯穿感知、预测和控制,而不是只作为一个孤立的输入信号。
这与跨传感器一致性是两个问题。戴盟构建了包含四种视触觉传感器的数据集,但不是简单地把已有数据拼在一起,而是先统一“如何接触”:让不同传感器经历尽量相同的交互过程,从初始接触连续按压至20牛,再在标准力下完成规定的探索动作,同时记录触觉图像、形变、剪切、深度和力。先建立共同的物理参照,再进行跨传感器学习。
在算法层,戴盟也没有要求不同传感器的feature完全相似,而是要求它们对同一物体的软硬、粗糙和凸起给出一致判断。换句话说,它对齐的不是数据长什么样,而是机器人对物理属性的判断。否则,一个传感器说软,另一个说硬,模型学到的只会是混乱。
如果这条路线走通,不同传感器可以保留各自的数据形态,模型却能形成相对一致的物理判断。戴盟争夺的,也会从传感器市场进一步深入到机器人如何表达和理解接触这一层。
目前,这种物理推理一致性能否扩展到更多传感器和机器人本体,仍需验证。但从统一触觉词元到跨传感器物理推理,已经构成了戴盟最有辨识度的技术路线。
03
通往世界模型的路上,先把生意做起来
戴盟另一个容易被低估的能力,是“沿途下蛋”。
数据显示,其视触觉设备已实现万片级出货,服务全球200多家客户,其中海外客户超过50家,并向OpenAI、Figure、Physical Intelligence、Meta、BMW和Google DeepMind等企业或机构完成设备交付。
虽然设备交付不等于进入核心供应链,也不能直接视为批量订单。但硬件先进入客户实验室,戴盟可以更早接触不同本体、任务和工程问题;这些反馈又会回到下一代传感器和模型。
在触觉数据的建设上,戴盟与中国移动启动“数采进家庭”网络。首个具身数据采集5S店落地湖南郴州,由营业厅完成设备发放、培训和服务,数采员再把设备带入家庭。首期计划投放1000套设备,满产目标为每年100万小时真实操作数据。
于是,一套飞轮有了雏形:传感器带来收入和客户,数采设备生产原生触觉数据,数据训练模型,模型再进入3C和汽车产线验证。
如果这套闭环跑通,戴盟卖出的就不再只是一颗传感器。每次设备交付都会带来新的任务和数据,模型能力提升后,又会反过来增加传感器和数据需求。硬件不再是一次性生意,而是模型进入物理世界的入口。
反过来,只要客户不复购、采集的数据不好用,或者模型POC迟迟变不成生产订单,这个飞轮就可能在任何一环空转。全栈能力看起来完整,不等于每一层都能挣钱。
触觉行业正在走出单点硬件竞争。下一轮要看的,是数据与模型能否跨设备复用,触觉能力能否真正进入生产和生活。
戴盟较早把视触觉传感器、数据采集、VTLA和世界模型接在一起,是这条路线上的开拓者。但真正的领先,在于能否把先发探索做成稳定、可复制的产品,让触觉经验能够迁移,让模型在产线和家庭任务中被客户反复使用。只有这样,触觉从机器人选配走向基础能力,才不只是一个行业判断。
— 欢迎在评论区留下您的想法 —
热门跟贴