当AI的“Token”日调用量突破400万亿,当机器人流量首次超过人类流量,一个根本性问题浮出水面:AI的“燃料”——高质量数据集,从何而来?答案指向一个全新业态:数据工厂。

2026年,北京交通大学联合北京化工大学、华为、蚂蚁集团等30余家机构,发布了《数据工厂白皮书》。这份138页的报告,首次系统性地提出了“数据工厂”这一概念,并对其内涵、类型、构成、建设模式和政策建议进行了全面阐述。

报告给出了一个清晰的判断:人工智能已发展到“奇点时刻”,而高质量数据集的匮乏已成为制约AI进一步发展的关键瓶颈。数据工厂,正是解决这一瓶颈的规模化生产设施。

一、AI“饿”了:数据需求正在爆炸式增长

一、AI“饿”了:数据需求正在爆炸式增长

报告开篇用一组数据描绘了AI的“饥饿”程度:

词元调用量爆发式增长。 2025年,全国词元日调用量从2024年初的1000亿跃升至年底的100万亿,两年增长超千倍。2026年5月,这一数字已突破400万亿

推理数据量首次超过训练数据量 2025年,人工智能数据应用总量达199.48EB,其中推理数据量达101.34EB,首次超过训练数据量的98.14EB。这意味着AI已正式从“学习训练”阶段转向“应用推理”阶段。

机器人流量首次超过人类流量。 2026年6月,全球HTML网页请求中,机器人(Bot)流量占57.5%,人类流量仅占42.5%。互联网正在进入“机器可阅读”的新时代。

但高质量数据集严重匮乏。 在互联网上能直接流通的数据只占全球数据总量的不到4%,还有96%的数据无法在互联网上直接流通——其中16%是非结构化的多模态数据,80%是涉隐涉密的私域数据。这些“供不出”的数据,恰恰是AI最需要的“燃料”。

报告指出,DeepSeek实现了“算力平权”和“算法平权”后,“数据平权”已成为AI在千行百业普及应用的最后一个堡垒

二、数据工厂是什么?——数智社会的“水厂”和“电厂”

二、数据工厂是什么?——数智社会的“水厂”和“电厂”

正如工业社会有水厂、电有电厂一样,报告提出:数智社会也必须有数据工厂

数据工厂是指面向人工智能大模型应用,开展高质量数据集设施化、规模化、标准化生产的数据基础设施。它是国家数据基础设施的基本构成单元,是突破人工智能发展瓶颈的有效手段。

报告将数据工厂划分为三种类型

  • 集中式数据工厂:将数据供应、生产、交付全过程集中在一个固定物理区域内。如帕西尼具身智能超级数据工厂(占地近12000平方米,部署150个标准化采集单元,年产近2亿条训练数据)。
  • 半集中式数据工厂:技术平台统一、加工场所分散。如美国Scale AI将数据标注业务部署到东南亚、非洲等多个区域,依托统一的数据引擎提供服务。
  • 分布式数据工厂:数据不需要汇聚到一个集中场所,而是通过数据虚拟化技术在数据原地进行处理,只将结果返回给平台。特别适用于国防、金融、医疗等安全要求极高的行业。

数据工厂呈现出多样化、规模化、标准化、设施化、AI化等五大特征。

三、数据工厂长什么样?——“三个车间”的完整生产链

三、数据工厂长什么样?——“三个车间”的完整生产链

狭义的数据工厂由储备车间、生产车间和中试车间三个部分组成。

  • 储备车间:数据原料的“供应基地” 。负责数据资源的规模化收储、标准化预处理和体系化管理。包含数据采集中心、数据存储中心和数据管理中心三大基础平台。其核心任务是把杂乱无序的原始数据加工成干净、规整、可用的“数据坯料”。
  • 生产车间:高质量数据集的“流水线” 。负责对储备数据进行深度加工处理,规模化生产可供AI大模型训练、微调、推理的高质量数据集。包含数据加工中心和数据标注中心两大生产中心,涵盖数据清洗、合成、增强、标注、质检、数据集管理等六大功能模块。
  • 中试车间:数据集投产前的“靶场” 。负责评估数据集质量及模型适配性、排查问题、优化数据,确保数据集符合模型训练要求。包含模型评估中心和数据集维护与更新中心。

白皮书将高质量数据集分为三类:

  • 通识数据集——面向社会公众的通用知识,如基础概念、通用原理等,无需专业背景即可理解。
  • 行业通识数据集——面向各行业领域的共性知识,如行业基础理论、通用技术等,需要一定专业背景。
  • 行业专识数据集——面向行业机构内部的专业知识,从研发、生产、管理、营销等环节中产生和积累,需要较深的行业背景和业务经验。

“三个车间”环环相扣,构成了从原始数据到高质量数据集的完整生产链条。

四、数据产业链的三个"薄弱环节"

四、数据产业链的三个"薄弱环节"

白皮书指出,面向AI的数智产业链已经形成——从通识高质量数据集到通用大模型,再到行业通识数据集、行业大模型、行业专识数据集、智能体,最后到千行百业的应用。但这条产业链上有三个薄弱环节:

第一个薄弱环节:数据"供不出"

全社会普遍缺乏付费使用数据的意识。一方面,社会公众和企业习惯于免费获取别人数据,而不愿他人免费获取自己的数据;另一方面,政府信息化项目中没有数据采购的预算。

非结构化数据采集难度大、成本高。非结构化场景是无限的,但数据极度匮乏,甚至完全空白。标准难以统一,标注自动化程度低,加工成本高。

第二个薄弱环节:行业数据"存不好"

高价值的行业数据大都分散保存在各部门、各企业,难以实现集中化和规模化。据统计,每年未使用的数据占比约4成。缺少完善的数据资源保存规范和指引,导致各行业数据保存规模和质量参差不齐。

欧美国家十分重视潜在价值数据的保存。美国国家安全局明确电子通信数据的存储周期达100年;荷兰要求医疗机构将医疗影像数据长期存储达100年。而我国部分行业虽然在信息化阶段对部分数据制定了存储范围和存储周期,但主要是考虑数据安全而非数据价值挖掘。

第三个薄弱环节:高质量数据集"作坊式"生产

当前,高质量数据集大多由AI厂商自行构建,呈现零散式、作坊式、非标化等特点。过去4年全球企业人工智能采用率增长了270%,我国更是增长了320%。但面向行业应用的高质量数据集供给严重不足。

白皮书直指问题本质:高质量数据集构建的投入产出不成比例。专业化数据的高质量标注需要庞大的资金投入且同时关联安全责任风险,这与数据应用的收益回报比例之间存在错位。

好比AI想吃满汉全席,但食材还停留在"小作坊"阶段。

五、国内外已有哪些实践?

五、国内外已有哪些实践?

报告梳理了国内外数据工厂的典型实践:

国外方面,美国Scale AI从数据标注公司发展为专业数据工厂,2021年获美国军方2.5亿美元合同,为战场情报分析规模化生产高质量数据集。美国“星际之门项目”投资5000亿美元建设AI基础设施,将高质量数据定位为“国家战略资产”。欧洲数据中心和欧洲数据实验室则强调数据主权和安全合规。

国内方面,崖州湾国家实验室发布“繁|未来农业智能枢纽”,通过汇聚全国多源头农业数据,建立覆盖基因组学、表型组学、环境组学的标准化数据集。贵州主枢纽存力中心依托“东数西算”工程,定位为国家级数据要素保障基地。库帕思“语料超级工厂”日生成语料接近1TB,覆盖具身智能、金融、医疗等多个行业。帕西尼具身智能超级数据工厂是全球规模最大的具身智能数据采集与模型训练基地。

六、怎么建、怎么用?——四种建设模式与四种运营机制

六、怎么建、怎么用?——四种建设模式与四种运营机制

报告提出了数据工厂的四种建设模式

  1. 数据标注企业升级:将零散式、手工化的数据标注企业转型为规模化、智能化的数据工厂。
  2. 数据存储基地转型:将“有存储无数据、有数据无加工”的存储基地升级为集中式数据工厂。
  3. 人工智能企业延伸:支持头部AI企业将内部“作坊式”数据生产独立出来,发展为数据工厂。
  4. 技术企业创新设立:通过数据编织、数据虚拟化等前沿技术,建设分布式数据工厂。

以及四种运营模式

  • 保障模式:面向国家重大战略需求,数据资源无偿提供,数据集有条件开放。
  • 定制模式:面向社会公益和技术创新需求,按需提供数据资源和定向开放。
  • 电商模式:面向市场化需求,按市场规则交易。
  • 结对子模式:面向重点领域和地方需求,引导龙头企业、大模型企业和解决方案提供商形成良性循环。

部署策略上,报告建议:在国家数据基础设施底座部署生产通识数据集的数据工厂;在区域重要功能设施部署生产区域通识数据集的数据工厂;在行业重要功能设施部署生产行业通识数据集的数据工厂;在各业务节点部署生产行业专识数据集的数据工厂。

七、部署策略:三层布局

七、部署策略:三层布局

白皮书建议根据国家数据基础设施的不同层级,将数据工厂分层部署:

在底座部署生产通识数据集的数据工厂,主要服务于基础大模型和通用性应用。由国家数据主管部门统筹规划,国家数据集团负责建设。

在区域重要功能设施部署生产区域通识数据集的数据工厂,由地方省级数据主管部门统筹规划。

在行业重要功能设施部署生产行业通识数据集的数据工厂,由行业主管部门统筹规划管理。

在各业务节点部署生产行业专识数据集的数据工厂,由行业龙头企业、专业机构等建设方负责。

八、发展建议:政策、标准、技术、平台四轮驱动

八、发展建议:政策、标准、技术、平台四轮驱动

白皮书提出了四项政策建议:

  • 加快制定促进数据工厂发展政策——明确数据工厂的功能定位、建设主体、运营模式和支持政策。建议加快出台《关于促进数据工厂新业态创新发展的指导意见》。
  • 启动数据工厂相关标准研制——构建覆盖数据资源汇聚、数据集生产、质量评估、AI应用等全链条的标准体系。
  • 突破数据工厂关键技术瓶颈——重点攻关非结构化数据采集技术、海量数据存储管理技术、智能化数据加工技术、数据集质量评估技术。
  • 加强数据工厂支撑平台建设——建设数据资源汇聚平台、数据集生产平台、统一数据流通基础设施、人工智能训练平台。
写在最后

写在最后

这份白皮书传递的核心信号清晰而有力:

人工智能正以惊人的速度重塑世界,而支撑AI不断进化的“燃料”——高质量数据集——的生产方式,正从“作坊式”走向“工厂化”。

当前,大多数高质量数据集的生产仍处于零散、非标、低效的阶段。正如报告所说:“数据工厂作为高质量数据集规模化、设施化、标准化生产的新型业态,是数智化发展新阶段的一种基本生产业态”

当AI的Token日调用量突破400万亿,当机器人流量超过人类流量,当96%的数据还无法被AI有效利用——“数据工厂”的诞生,不是选择,而是必然。

报告节选

报告节选

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片