当业界集体呼唤具身智能的"ChatGPT时刻",数据正成为整个行业最大的"渴点"。2026年世界机器人大会上,洗碗做饭、负重搬运、精密制造——机器人集体打工的"班味儿"越来越浓。然而热闹背后,一个现实考题愈发尖锐:具身智能到底缺什么数据?或者说,什么样的数据才算"好数据"?

一场从"十万"到"千万"的鸿沟

先看一个触目惊心的数字。据行业机构测算,当前国内真实物理交互场景合规数据仅约50万小时,而机器人商业化落地需要数千万小时数据,缺口超过99%。这是一个从"十万"到"千万"量级的差距。与多模态大模型动辄数千万小时的视频数据、几十万亿Token的文本数据相比,具身智能的数据家底薄得可怜。

但比"量不够"更棘手的是"质不齐"。行知启航CTO耿赛猛将当前的具身智能模型训练比作一场"现代炼金术"——模型像配方,算力像炉火,数据则是原料。具身智能的涌现需要高质量数据、合适模型和有效训练的共同作用。问题在于,行业目前还在快速探索"最佳配方"的阶段,而数据这个原料,连质量标准都没统一。

转机出现在2026年。由工业和信息化部批准发布、中国信息通信研究院联合行业40余家单位起草的《人工智能 关键基础技术 具身智能数据集质量要求及评价方法》(YD/T 6771-2026)将于2026年11月1日正式实施。这份标准首次为具身智能数据集划定了质量底线,标志着行业从"规模导向"向"质量导向"转变。

标准的核心是一套八维度评价指标:完整性、一致性、多样性、真实性、易用性、实用性、可扩展性和安全性。八个维度各有侧重——完整性确保数据不"缺胳膊少腿",一致性保证不同来源的数据能"说同一种语言",多样性让机器人见过足够多的世面,真实性确保数据来自真刀真枪的物理世界而非凭空捏造。

这套标准的意义,中国信通院AI所具身智能机器人部副主任张蔚敏说得直白:"标准的意义只是为了尽快地让大家降低试错成本。"对数据提供方,统一的质量要求能规范生产流程、明确交付底线;对数据需求方,则提供了清晰的质量验收依据。正如标准解读所概括的:让数据"采得准""结构清""用得上""管得住""评得清"。

比数量更金贵的,是"错题本"

标准划定了底线,但高质量数据的真正内涵远不止于此。

四维图新(002405)CEO程鹏在世界机器人大会上抛出一个耐人寻味的判断:"具身数据的价值不能只看数量,真正稀缺的是包含动作、反馈、错误与纠正过程的真实交互数据——机器人需要的不只是‘正确答案’,也需要自己的‘错题本’。"这句话点破了具身智能数据与传统AI数据的本质区别。大语言模型可以从互联网文本中学习,但机器人要理解接触、摩擦、遮挡、光照变化,以及大量长尾场景,这些仅靠互联网数据无法获得。

墨奇智能联合创始人兼CTO黄青虬也持同样观点:"当前行业接触到的具身数据质量是不够高的,并且缺乏统一的标准,真实场景的数据质量,远比数据数量更重要。"

高质量的具身数据,首先得"真"。星海图CEO高继扬直言:"什么是最高质量的数据?真实数据是最高质量的。"真实世界的物理交互数据具有"不可替代性",与互联网语言、视觉数据存在本质差异。其次得"多样"。如果机器人永远只在同一个实验室、同一套桌椅、同一种光照下训练,它很可能只是记住了这个环境,而不是真正学会了任务。不同地域、不同场景、不同物体、不同操作人员形成的数据差异,恰恰是机器人提升泛化能力所需要的"生活经验"。

还得能"闭环"。真正高质量的数据不是一次性消耗品,而应该形成"数据训练—仿真评测—真机部署—反馈迭代"的完整回路。机器人上岗之后的学习经验再反馈回来,作为新的数据支撑它进一步学习——这才是可持续的高质量数据生态。

昂贵的数据,到底值不值

高质量数据的"贵",是行业共识。星海图给出的成本测算很具体:Human-Centric Data采集成本约每小时50至100元,Robot-Centric Data约每小时250元,行业平均数据成本约每小时100至150元。采集100万小时数据的成本就在1亿至2亿元之间。传统的遥操作数据采集单条有效数据成本约10至50元,而训练一个机器人通常需要数万到数十万条数据。单台数采设备从几万元到十几万元不等。

但高继扬算了一笔更大的账:智能总成本分三部分——数据成本、算力成本、工程师成本。他们公司的实践至少是1∶10,即1块钱的数据至少得花10块钱的算力去做训练,才能把它训明白。"真正昂贵的不是数据本身,而是低质量数据带来的训练浪费。如果输入的是不那么有效的数据,产生的模型也不会有太大价值。"

好消息是,行业已经动起来了。截至2026年8月,全国共建成启用超过70家具身智能训练场,在建或规划中的还有40多家,训练场产业链已初步成形。长三角、京津冀、珠三角三大核心集群已经形成。

数据集层面也频频传来好消息。智元机器人的AgiBot World数据集,依托2000平真实采集场景,覆盖217个复杂操作任务、3000多件操作物品,相比Google的Open X-Embodiment数据集,长程数据规模高出10倍,场景范围覆盖面扩大100倍,数据质量从实验室级上升到工业级标准。该数据集构建了"标准化采集流程+自动化质检+人工在环审核"三维质控机制,数据准确性达到99%以上。2025年3月,英伟达在GTC大会上推出的具身基座模型GROOT N1,其80%的真机训练数据来自该开源数据集。

2026年世界机器人大会期间,光轮智能发布了全球首个十万小时级全模态人类行为开源数据集EgoSuite-Open100K,覆盖7大类环境、128类场景、15000余个采集场景与15000余项任务。光轮智能联合创始人兼总裁杨海波判断,"2026年是具身智能数据规模化的元年"。

结语

具身智能的竞争焦点正在从模型转向数据。耿赛猛说得很透彻:"模型架构会快速传播,算力可以采购,唯独高质量真实世界数据难以在短时间内复制。"这并非简单比拼"谁有更多数量",真正竞争的是持续获得高质量、高多样性、高物理保真且能真正转化为模型能力的数据。

当数据从"瓶颈"变为"引擎",具身智能的规模化落地或将迎来真正的拐点。谁能率先填平这道数据鸿沟,谁就有可能在这场智能革命中抢占先机。而这一切的前提,是我们真正理解了一个朴素但重要的问题:机器人需要的,从来就不只是"正确答案"。