界面新闻记者 | 徐美慧
界面新闻编辑 | 文姝琪
机器人的下一场竞争,越来越绕不开数据。
中国信通院人工智能研究所等今年8月发布的《具身智能训练场研究报告(2026年)》显示,截至2026年6月底,国内已建成启用超70家具身智能训练场,另有46家在建或规划。训练场越建越多,但一个基础问题仍没有解决:什么样的数据真正有用,又怎么把规模做起来?
近日,由智元机器人孵化的觅蜂科技宣布其第2万套MEgo无本体数据采集设备正式下线,并称累计生产超过100万小时无本体数据。
从真实物理交互数据的采集方式看,目前常见的是真机和无本体两类。真机数据通过遥操作或机器人自主运行采集,直接对应机器人关节、动作等信息,但成本和产能受本体数量限制。无本体数据主要由人佩戴第一视角、腕部等设备采集,不绑定某一款机器人,更容易覆盖不同场景,但后续还要经过空间重建、动作映射和数据治理。
觅蜂科技董事长兼CEO姚卯青在接受包括界面新闻在内的媒体采访时表示,无本体和真机不是相互替代的关系,前者更多用在预训练阶段学习通用表征,后者负责后训练,任何一个任务要真正落地,都绕不开对应本体的真机数据。
庞大的数据缺口,是各地训练场密集落地的直接原因。上述报告测算,具身基础模型要达到类似“ChatGPT时刻”,至少需要千万小时级真实数据,而当前全球可用的高质量真实数据仅为数十万至百万小时级。
IDC发布的《中国人工智能基础数据服务市场研究报告,2025》显示,2025年中国AI基础数据服务市场规模为62.62亿元,同比增长27.8%,预计2026年增至78.34亿元。其观察到的另一个变化是,数据需求正在从单纯的大规模采集转向任务数据,客户也从传统AI企业扩展至自动驾驶、具身智能等领域。
谁在买这些数据,也比之前变得更清晰了一些。
姚卯青称,目前需求方主要包括大模型公司和机器人公司。前者希望利用人的操作数据训练多模态认知、决策和世界模型;后者则更多关注动作轨迹、任务拆解以及向机器人关节动作的映射,相关数据可以用于模型预训练,并在后续与真机数据结合。
觅蜂当天将第2万套MEgo设备现场交付给京东,并宣布与腾讯Robotics X实验室开展无本体数据业务合作。京东科技集团副总裁何贺现场表示,京东同时是数据的采购方、采集方和场景方,京东此前提出的目标是两年采购1000万小时数据。
与2万套设备一起披露的,是100万小时无本体数据。据觅蜂披露,这批数据全部来自开放环境中的真实采集,覆盖22大类场景、1万余个真实环境、5万余类物体及500余种细分任务,涵盖居住、办公、零售、生产、仓储、餐饮、文娱休闲、交通出行等八大场景,延伸至公共服务、物流、医疗、教育、养老、文旅、汽车服务、农业生产等长尾场景。
觅蜂称,目前,其百万小时级无本体数据已开始服务腾讯Robotics X实验室、蚂蚁灵波等客户。
真正拉开差距的,是这些数据交到客户手里后能不能用。
姚卯青提到,今年上半年行业还在快速试错,到下半年,头部客户的需求开始收敛,60FPS、1080P、双目、深度等逐渐成为常见要求,对时间同步、空间标定精度、设备重量和稳定性的要求也明显提高。
他说,年初拿手机、运动相机采一采都能卖,这类需求现在还有,但会随着专业化产品的出现逐步下降。
虽然标准在收敛,但还远谈不上统一。中国科学院科技战略咨询研究院曾发文表示,具身智能高质量数据集建设目前仍面临技术路线不统一、建设主体分散、共享机制不畅等问题,不同企业和科研机构在数据格式、语义标注、机器人传感器配置和控制模态上存在差异,数据难以跨主体、跨场景复用。
因此,小时数只是第一道门槛。姚卯青提到,重复做同一种任务,即使很快堆到100万小时,也可能没有太大训练价值,如果数据翻开全是家居、叠衣服等重复场景,同样难满足头部客户。客户还会看场景覆盖、动作是否自然、手部位姿精度,以及数据最终有没有通过验收。
数采工厂的效率差异同样很大,有的人员工作8小时能产出4个小时的有效数据,有的只能产出1小时有效数据,管理、培训和设备稳定性都会直接影响产能。据其透露,行业目前较常见的结算方式也是按有效小时,而不是人员实际工作时间结算。
这让数采越来越像一门运营生意,而不只是卖硬件。
另一个变化是,数据采集开始走出专业数采工厂。姚卯青称,目前已经有社区退休人员、宝妈等在参与数据采集,公司通常与同时具有人力和场景资源的合作方一起运营。
在姚卯青看来,如果数据量要从百万小时走到亿小时,仅靠数采工厂线性复制并不现实,众包可能是必须跨过的一步。
他设想,数据采集会从集中式走向半集中式,最终出现类似骑手、网约车司机的灵活就业模式,让不同行业的人把技能、时间和经验变成可以量化结算的数据。
类似的众包尝试也已经在海外出现。8月25日,Figure推出Index,用户可以自行上传第一视角操作视频,也可以预约Creator到家庭或企业场景完成任务。Figure称,过去4个月已有超过26万次应用下载,并计划未来12个月在数据和算力上投入超过10亿美元。
姚卯青评价表示,从Figure目前公开的介绍看,Index展示的内容仍有较多家务类场景,觅蜂则希望把众包覆盖到更多行业。
不过,这条路径的难点也很明显。众包意味着采集人员更多、场景更分散,设备如何流转、人员如何培训、进入真实家庭和商业场所如何获得授权,都会提高质量管理和合规成本。
这些数据怎么卖,行业也还在摸索。
姚卯青称,目前具身数据没有标准定价,价格会随着场景稀缺程度、进入难度和交付周期变化。行业常见的交易方式,一种是出售使用权,产权仍由数据公司持有,买方不能二次商业化;另一种是独享买断,产权转移给客户,数据提供方需要删除自身服务器上的对应数据。数据不同于实体商品,如何确认使用范围、避免未经授权的二次流通,也是数据交易需要解决的问题。
对于行业格局的未来,姚卯青的判断是,具身数据最终会走向寡头分布。
他的理由首先是投入门槛。按其说法,这个行业目前是重投入,几万套设备需要亿元级投入,能够存储数百PB乃至上千PB数据的数据中心同样需要较大的资金投入,同时还考验工程和运营能力。
此外,姚卯青还提到一个眼下无解的问题,同一家模型公司混用多家来源的第一视角数据往往训不出效果,短期解法只能是集中选一到两家供应商。
热门跟贴