打开网易新闻 查看精彩图片

采集与应用依然隔着一座大山。

具身智能行业怕是从没经历过这样荒诞的时刻,让不少人开始反思第一代数采模式的合理性。

事情始末是传闻北京某头部具身智能企业的外包,为了获得家庭场景数据,在和居民协商一致后,带着录像设备进入居民家中采集数据。“刚开始居民觉得新鲜,很配合,但数据采集效率极低,需要不断重复,后边居民开始烦了。”一位知情人士透露,“他们带着团队去北京老旧小区敲门,老太太都报警了。”

这不是孤例。近期还有报道称,某公司采集员穿着数据采集马甲进入小区,假装社区服务检查家里设备,开门后发现是来“拍视频”的,场面一度尴尬。还有人在某书爆料称,有公司找了农村大妈采数据,但最终以数据不合格为由拒绝支付此前谈好的薪资导致报警。还有爆料称,某大厂重资建设的数采工厂,采集的数据因为无法出口交易已经出现了囤积。

打开网易新闻 查看精彩图片

2026年,所有人似乎都相信一件事:只要数据足够多,Scaling Law就能在物理世界重现。竞争的重心正在从把机器人做出来转向给机器人喂够数据。为了采数据,全球的机器人公司正在想尽一切办法,找外包,钻进真实世界,居民楼、工厂、仓库、食堂、超市、农田。

但有一些问题,没有人认真回答过,这些数据到底怎么采才长期可持续、数据结果有效?以及,数据采集了,然后呢?

01.

50万小时vs千亿小时:一道算不清的账

数据训练场一度被认为是数据采集的最优解,这个模式没有错,所有参与方也基本认为是有价值的产业,就是烧钱,而且有效数据规模上不来。

据中国信通院不完全统计,截至2026年6月底,全国建成启用超70家机器人训练场,在建或规划中的训练场46家。有媒体此前曝出,中型数采⼚⼀般需要50台数采设备(主要是阵列式高速相机,而非传统视觉产品),总投⼊(含硬件等)在5000万左右,50台设备要配备100名数采员,按照每⽉22个⼯作⽇、200元⽇薪计算,每年⼈⼒成本已超过500万,加起来的整体硬成本⾼达1500万。若是⼤型数采⼚,整体投⼊更是两倍以上。

但国金证券研报《中国具身智能产业发展报告(2026)》显示,截至2026年初,所有可用的高质量真实物理交互数据加在一起,大约只有50万小时。行业估算,要让一个通用机器人在常见任务中达到70%至80%的基础成功率,需要的数据量级是1亿小时。如果目标是真正“开箱即用”的通用具身智能,这个数字可能要攀升到千亿小时。

50万对1亿,差距200倍。50万对千亿,差距达20万倍。更扎心的数字来自斯坦福大学2026年4月发布的《AI Index Report 2026》,该项研究表示,如果按照能够进家庭的指标来看,目前数据量下,全球通用人形机器人在真实家庭场景中的任务成功率只有12%左右。而且从2024年到2026年,这个数字几乎停滞不前,两年间提升不到2个百分点,数采工厂数据在这类场景的模型训练效果并不明显。

打开网易新闻 查看精彩图片

然而数据采集的成本却已经不低。野村证券在2026年7月发布的中国机器人行业报告中指出,一条30秒的真机操作数据,采集成本已经高达5到15元,单价约为每小时500至1000元人民币,凑够20万小时需要两亿元以上。若完成百万小时真机数据预训练,投入成本将达到10亿元量级。

行业花了两年,建设70多个训练场,前后投入的资金可能几百亿,但真实世界的任务成功率只涨了不到2个百分点。有企业坦言,花几千万元采集的10万小时数据,只能帮助模型能力提升5%。而且,在A场景采集训练后学到的技能,换到B场景大概率失灵。

这不是算法的问题,本质上是整个行业对“数据”这件事的认知可能出了问题。

打开网易新闻 查看精彩图片

02.

采集12小时,只能用1.5小时?

数据采集的难度,远超外界的想象,这不是靠着建设一两个训练场能够实现的。全球具身数据行业面临的第一个核心难题是可采集数据规模不等于“可训练数据规模”。具身智能不是单纯缺数据,而是开始进入有效数据稀缺的阶段。

首先,原始数据仅仅是被正确“记录下来”,已经很难了。机器人每执行一个动作,需要同时处理一条多模态的时序数据流:RGB图像、深度信息、关节角度与角速度、末端位姿与受力、指尖触觉阵列的压力分布,整个处理下来难度并不低。

一位具身数据企业的创始人指出,数采生意当前面临的一大问题在于,供需双方都没想清楚该采什么、怎么采,用什么设备采,价格与合格线怎么界定,比如甲方的需求文档有时写得很粗糙,缺乏可落地性。从2025年下半年开始,⾏业也迅速转向了两条⽆本体采集路线,⼀种是采集Ego数据,也就是让数采员戴上头戴式摄像头⼲活,设备录下⼯作画⾯与⼿部动作;另⼀种则是UMI数据采集,数采员戴着末端夹⽖/⼿套⼯作,靠硬件上的相机与传感器记录动作。

有分析师就透露,目前全球市场上大量出现这种戴着头戴设备在真实环境里采集ego数据的设备,最低能以7元一小时的价格出售。但因为不同品牌的硬件构型不同,采集的数据格式不统一,数据孤岛现象严重,有公司尝试将20多个品牌的20多万条数据放在一起混合训练,结果一塌糊涂。这种异构数据“数据越堆、效果越差”的负迁移难题,使得部分厂商提供的传统无本体数据更像个“黑箱”,你不知道真机到底能不能跑通。

香港大学等团队在T-RO发表的研究就提出了一个反直觉的结论:“跨本体预训练数据并非必要。因为在高质量单本体数据上训练的模型,微调阶段反而比多本体预训练表现更好。演示者多样性甚至可能适得其反,不同人的操作习惯差异会对策略学习造成干扰。”这意味着你花大价钱采来的“通用数据”,可能根本没你想的那么通用。

打开网易新闻 查看精彩图片

其次,这些数据即使“合格”,大多其实需要经过清洗、标注和对齐,才能够进入客户的训练管线。

因为数据没有形成统一标准,不同厂商硬件采集的数据,视场角、帧率、精度各不相同,触觉、视觉之间时间同步精度参差不齐,甚至出现丢帧问题,最终导致A机器人采集的数据,B机器人无法直接使用。公开数据集的这些数据不仅模态各异、采样频率不同,真正想要将其变为可用,还必须在同一个时间基准上严格对齐,视觉看到的那一帧,必须对应上触觉感受到的那一次挤压,对应上电机输出的那一组力矩。任何一路信号错位几毫秒,这条数据就可能沦为噪声。

而且数据清洗这一层的损耗最为惊人。有公司批量买回数据后,团队一半的人被拖去干数据清洗,折腾了近一个半月,数据的有效率只剩10%。多家具身本体公司透露,清洗数据的成本已经远远高于采集数据的成本。采集1小时真机数据成本约1000元,但清洗让它“能用”的整体中间成本可能是采集本身的数倍。

“采集12个小时,清洗出来能用的,超过1.5个小时就谢天谢地了,这已经是行业高水平。”有国内数采企业介绍,大多企业的数据有效率12.5%。而行业普遍水平可能连这个数字都达不到。国外近期有研究也表示,全球两万小时训练数据中,有效数据不足三千小时,有效率不到15%。

打开网易新闻 查看精彩图片

更令人尴尬的是,这些无用数据还挺占内存。随着内存条价格持续飞涨,当前有超过60%的公司选择直接删除至少一半此前花费重金采集的历史数据,因为早期质量太差、格式不统一、与新模型架构完全不兼容。花100%的钱,采回来的数据,由于缺乏质检漏斗,入库有效率角较低,一半以上直接被删了。

有分析师认为,真机遥操作在例如数采厂等方式规模化运营后的单小时有效数据成本可以降低到约为275元,非定制化的无本体数据采集费用约为每小时百元级别,但这些数据的提纯并且达到满足国外模型公司收购要求的基本线很难,这导致大部分数据找不到买家。

不是没人想把这条数据采集、、标注、清洗等流程的管线标准化,但训练一个垂类场景基本可用的数据处理管线,通常需要数万到数十万条数据,这就卡死了大部分原意参与该环节的玩家。

03.

标准不统一,数据根本没有飞轮

由此可以看出,其实具身数据采集存在两层有效性标准:采集有效(原始数据被正确记录)、数据集有效(经过清洗标注能进入训练管线),但在具身智能和物理AI的场景需求下,更潜在的需求是模型有效(真正让模型能力提升),也就是采集规模扩大以后,这些数据能否真正提升机器人的稳定性和泛化能力?

目前,多数供应商只能保证前两层,客户却期待第三层效果。

打开网易新闻 查看精彩图片

大家都希望构建数据飞轮,然而,从数据角度看,飞轮的构建远比想象中复杂。智源研究院王鹏伟在智源大会上就指出,当前模型仍主要停留在理解世界或模仿动作层面,对未来状态、因果关系和物理规律的建模不足。真正面向物理AGI的世界模型,应能在多模态信号中形成统一状态表征,并学习状态如何在真实世界中演化。

这意味着,具身智能的模型训练需求下,数采需要从数据中提取出物理世界的因果结构,这比单纯堆数据量难几个数量级。但大多数数据公司的模式是:采集→清洗→交付→结束。数据交付之后,模型训得怎么样、哪些数据有效、哪些数据冗余,这些信息几乎没有回流到数据采集环节。

因为几乎没有人认真回答过,物理世界的“经验”,真的能被这样采集到吗?到底该怎么数据化?目前这些采集的数据到底有价值吗?

Ropedia联合创始人刘子纬在AGI Playground 2026上说了一句话:“AI读过一切,却从未真正体验过任何事。”大语言模型学习的是人类写下了什么,文本天然是数字化的,互联网上应有尽有。但物理AI需要学习的是人类做了什么、世界对动作作出了什么反应、以及最终发生了什么。

这是物理AI与数字AI最本质的差异。不是数据量差了几个数量级,而是各个场景数据的“质地”完全不同。这些变量,在互联网上不存在,在文本里不存在,在大多数采集回来的数据里,也未必存在。

全行业花了几百亿去采集数据,数采的效果却没办法评估,因此,大部分人做的事情,本质上是在用更快的速度、更低的成本,生产一种物理世界经验的“影子”。看起来像经验,但实际无用。

全球具身智能行业在做一个豪赌,赌Scaling Law在物理世界依然成立。赌注是百亿融资、千亿估值。但物理世界的规律,真的能被简单的“数据堆叠”所掌握吗?50万小时对1亿小时的缺口如今依然摆在那里。更可怕的是,就算你采够了1亿小时,这些数据真的能让模型变聪明吗?没有人能证明这件事。

更可怕的是,没有人愿意为“别人的模型变好”买单。数据公司赚的是交付的钱,模型公司赚的是产品的钱,场景方赚的是效率的钱,这三者的利益,从来就不在一个飞轮上。

飞轮不是画出来的,是转出来的。你卖的是数据集,客户要的是“模型变聪明、飞轮跑起来”。这中间的落差,正在制造越来越多的摩擦和失望。

行业花了几百亿去采数据,但没人认真算过,采回来的数据,到底有多少真的能喂进模型?有行业人士表示,真正能让模型变聪明的,可能连1%都不到。

说是数据漏斗,实际上上面倒进去一桶,下面漏出来的只有几滴。每一层都在“吃掉”数据的价值。大多企业所谓的“百万小时里程碑”,本质上不过是“十几万小时可用数据”的华丽包装。这种“真实数据量”,才更像是数据泡沫。

打开网易新闻 查看精彩图片

在这个情况下,大政策层面也在试图规范。例如2026年7月,工信部批准发布了首个具身智能数据集质量标准。评价指标涵盖完整性、一致性、多样性、真实性、易用性、实用性、可扩展性和安全性八个维度。紧接着,市场监管总局又发布了《人工智能具身智能数据质量规范第1部分:真实数据》等60项国家标准化指导性技术文件。

有标准是好事。但标准解决的是“怎么评价”,解决不了“怎么生产”。因为就算标准出来了,谁来执行?现如今,头部客户的采集需求其实已经开始收敛,60FPS、1080P、双目、深度逐渐成为常见要求,大家都在各自建设数据管线。而且这种事实标准是头部玩家定义的,中小企业和科研团队只能被动跟随。

更残酷的是,这场标准之战,在具身智能企业超过百家的当下,很可能短期等不到快速统一的那天。类比自动驾驶行业花了十年才勉强统一了数据格式。具身智能的数据维度比自动驾驶复杂一个量级。多模态、三维空间语义标签、时序对齐。这个标准之战,没个三五年打不完。

打开网易新闻 查看精彩图片

04.

7块钱一小时,和170亿的生意

短短两年时间,数据缺口催生了一条完整的产业链,产业链上的公司快速拿到融资,但割裂也在不经意间发生。

2026年上半年,25家中国具身智能数据创业公司合计拿到超过170亿元的融资。全球首个具身数据独角兽光轮智能,一季度狂揽5.5亿元订单。具身智能融资总额已达935亿元,超去年全年67%。

然而,产业链的顶端,是光轮智能们,估值百亿,订单过亿。底端,是全球各地的数据采集员。有人戴着头戴设备在真实环境里采集数据,以7元一小时的价格卖给机器人公司。一位全职妈妈接居家采集的活,一天拍满8小时,能用的不到一半,到手只有120块。

培训负责人跟她们说:“你们拍的每一帧,都是机器人看世界的眼睛。”话很漂亮。但对采集员们来说,这不过是一份日结的、重复的、随时可能因为设备故障而白干的活。他们是燃料,不是炼金师。数据的商业模式本身存在天然缺陷。数据不是有形实物,确权、定价、流通都比实物商品复杂得多。目前具身数据没有标准定价,数据资产化还远未到来。

数据采集成了一门好生意,170亿融资砸进去,设备卖出去,数据采起来。但仔细一看,真正靠“卖数据”本身赚钱的,几乎没有。“确定”的只是融资,不是数据本身的价值。赚钱的是卖设备的、卖采集服务的、做融资的。最底层的数据采集员拿的是时薪7块,最顶层的资本玩家拿的是百亿估值。同一组数据,两端是截然不同的命运。

打开网易新闻 查看精彩图片

而且最尴尬的是,这些数据采集之后,没有太多人花钱购买,并且训练出真正可用的具身大模型。

05.

写在最后:数据采集了,然后呢?

“采到老太太报警了”,这句话,是2026年具身智能行业最荒诞也最诚实的写照。为了采数据,公司派人去敲居民的门。为了采数据,采集员在样板间里一遍遍重复同样的动作。为了采数据,行业花了更多钱、建了更多训练场、攒了更多万个小时数据。

但真实家庭场景的任务成功率,两年只提升了不到2个百分点。数据采集了,然后呢?然后,大部分数据被堆在服务器里。它们会被清洗,花掉采集成本数倍的钱。会被标注,不同厂商、不同标准、不同格式。会被包装成“数据集”卖出去。买方拿去做预训练,发现效果不如预期,于是再找下一家供应商。这不是数据飞轮,这是数据黑洞。

数据从采集端流入,没有经过清洗、标注,就走到交易市场,最终消失在模型训练的“黑箱”里。没有人知道哪些数据真的有用,哪些是噪音。最终也没有人能把“模型训练的效果”反馈回“下一次该怎么采集”。但是全球基本都明白所采集数据的价值。

整个产业链,虽然训练场在加多,但管线是断裂的。大语言模型的成功路径是清晰的。互联网上已有海量文本→大规模预训练→智能涌现。但物理世界没有现成的数据,这必然需要人工采集,导致采集成本极高,以及数据质量参差不齐,从而模型效果有限。

这是一个先有鸡还是先有蛋的死循环。“采到老太太都报警了”当下还能解决,但如果采回来的数据依然无法让机器人真正学会干活,那报警的就不只是老太太了。