8月28日,2026中国国际大数据产业博览会(数博会)在贵州贵阳启幕。会上,华为发表主题演讲,高质量数据集是AI智能跃迁的基石,数据基础设施的演进应沿着“聚好数、治好数、用好数”三大核心路径稳步推进,持续夯实存力中心底座,实现高质量数据集规模化供给。

打开网易新闻 查看精彩图片

当前,我国已是全球数据大国,数据规模高速扩张、配套政策密集出台,但有效数据、优质语料的供给仍短板明显:全国数据留存率仅2.8%,海量数据从源头即被丢弃;数据共享率不足25%,孤岛问题突出;全球语料中文占比不足2%,成为我国大模型长足发展的重要制约因素。

存力中心作为新型数据基础设施,是激活数据价值、驱动产业升级的关键载体。为打通“聚数-治数-用数”的全链路闭环,应着手从城市与行业两大层面协同推进:

城市层面:打造先进城市存力中心,加速数据规模汇聚与留存

城市层面:打造先进城市存力中心,加速数据规模汇聚与留存

构建数据可信托管中心、治理中心、开发中心和流通中心,破解城市公共与行业数据集分散持有的难题,促进数据集集约化、标准化供给。通过完善全域数据汇聚、治理、可信流通体系,助力数据从“资源”向“资产”转化,充分释放数据要素核心价值。

行业层面:驱动多维数据智能融合,行业存力中心加速高质量数据集构建

行业层面:驱动多维数据智能融合,行业存力中心加速高质量数据集构建

通过产业链协同与生态共建,推动数据由分散利用向多维智能融合升级,全面提速行业高质量数据集建设进程。其中,某国家级农业实验室已形成典型实践范本:其基于一体化数据基础设施,打造“1总部+6分中心+N实验基地”的育种科研大数据生态平台,构建包含基础语料库、大豆/玉米/生猪等专题库的多模融合数据集,成功落地精准育种智能体,显著提速科研创新进程。

针对数据基础设施存力中心的建设实施层面,肖德刚介绍,华为推出AI数据湖解决方案,聚焦从三个维度为高质量数据集夯实根基:

  • 首先,破解“聚数之困”:基于OceanStor Pacific数据湖存储,结合iMaster DME Omni-Dataverse统一数据空间,使能EB级数据全局可视、可管、可用。通过全局统一视图,确保数据资产注册0遗漏、更新0等待;凭借智能数据目录,完成跨域数据统一元数据管理,支持自动编目及向量化;同时依托可信数据空间,保障跨域数据流动可信、可证、可控。
  • 其次,化解“治数之难”:通过DCS一站式AI工具链,攻克AI落地过程中数据工程、模型工程、应用编排等难题。内置60余种多模态算子,将数据处理周期缩短80%;支持一键部署模型,兼顾训推共池调度、昼推夜训能力,提升智算资源利用率30%;通过零代码拖拽式可视化编排,让AI行业应用上线周期缩短80%。
  • 最后,根除“用数之痛”:依托iData AI数据服务,搭建完善的知识工程体系,贯通知识建模、提取、融合全流程,助力海量数据源快速沉淀为高精度业务知识库。一方面,让知识从数据中高效萃取与生长,基于专家经验建模,结合端到端工具链,快速建立跨模态知识图谱,知识激活率提升70%;另一方面,让海量多模知识被精准调用,支持以自然语言方式驱动的极速检索形式,完成千亿向标量数据中秒级检索,检索精度超过90%。

注:本文转自华为为数据存储,版权归作者所有

打开网易新闻 查看精彩图片