打开网易新闻 查看精彩图片

过去六年,AI 产业完成了一次漂亮的三级跳。算力层面,2021 年到 2025 年规模翻了 6 倍,2025 年达到 1 千EFlops;模型层面,截至 2025 年在测大模型达 1500 个,新的开源模型不断在世界范围内引起巨大反响;应用层面,2024 年中国日均 Token 量已进入十万级,Token 工厂、Agent 运行成为 AI 落地的重要途径。

算力、模型、智能体落地都有了,下一块,无疑是数据。华为公司副总裁、数据存储产品线总裁袁远在 2026 华为数据存储用户精英论坛暨 OceanClub 嘉年华上给出了这一核心论断。

打开网易新闻 查看精彩图片

模型需要高质量的语料来做训练,语料的规模和质量直接决定了模型能力的上限。推理更离不开数据,没有高精度的知识做支撑,模型就会产生幻觉,推理出来的结果根本不可用。而到了智能体阶段,对数据的需求更是呈指数级放大:智能体需要大量的上下文、需要在不同任务之间多轮次地调用准确信息、需要语义级别的精准检索,还需要把自身运行过程中产生的经验数据全部存下来,形成记忆,让下一次决策比这一次更聪明。

然而,数据显示,中文语料在全世界语料中不足 2%,数据留存率不及 3%,数据“沉睡”率超过 60%,共享率仅 25%。袁远直言:的数据本身能力和管理水平相对于现在的模型、算力、智能体实际上是落后的。

于是,一个核心问题是,在算力规模持续扩容、大模型品类集中爆发、智能体业态蓬勃涌现的当下,为什么绝大多数企业的 AI 落地依然困难重重?

打开网易新闻 查看精彩图片

在旧 IT 上打补丁,打不出 AI 新世界

要理解当前企业AI落地的困境,不妨先看看传统 IT 是怎么走过来的。

袁远在演讲中做了一个清晰的类比:传统 IT 经过几十年磨练和演进,逐步形成了一套公认的参考架构——应用层、中间件、虚拟化、计算、存储、网络,成为私有数据中心的标准化部署模型。

但现实是,绝大多数企业的 AI 实践,仍是在传统 IT 堆栈上做加法:用旧存储存数据、单独搭算力集群、外挂第三方工具链、智能体再套新框架。数据链路断裂,效率低下,安全风险丛生。长期以来,行业长期缺乏一个清晰的建设标准——数据怎么存、知识怎么管、系统怎么优化、安全怎么防护……企业只能各自摸索、重复造轮子。

因此,要打破这一困局,企业需要的不再是零散的补丁。华为认为,AI DC 数据基础设施部署架构,应该以数据为中心,围绕AI全生命周期展开,层层支撑,协同强化

打开网易新闻 查看精彩图片

最顶端,每个企业都需要有一个智能体环境——能帮助开发、运行智能体,同时支撑智能体自我演进。过去,企业都有自己的 PaaS 平台或应用平台,未来企业也需要一个专属的智能体平台。

第二层,是模型层。将来每个企业的模型肯定不只是一个,可能有几十个甚至上百个的部署诉求。这些模型需要管理,要缩短部署的 time to market;模型的调优、对齐、评估需要一组完整的工具链;模型也要能够根据应用要求不断换入换出。

第三层,是算力。计算资源不能是僵化的。GPU、NPU 卡都很昂贵稀缺,要像传统 CPU 虚拟化一样,对计算资源进行按需调度、按小块分隔、按细粒度提供服务——这就是智算虚拟化。

再往下两层,完全跟数据相关。其中AI 数据平台层是一个关键的分水岭。如果我们想让 AI 做事,就必须符合传统企业应用的要求。第一,企业必须要有高精度的知识,准确率要达到一定水平(比如医疗场景需要 90% 以上)。第二,企业必须有足够好的 KV Cache,保证推理性能可预测。第三,企业必须有一个轨迹系统,让智能体能够自我演进、越用越聪明。这三个能力具备以后,AI 才能进入企业的生产环境去作业。

最下面一层是数据湖层。现在数据使用上最大的问题是数据割裂——数据散落在不同环境,格式、管理方式异构。数据湖首先要构建企业逻辑或物理上的集中数据整体,有统一格式,能够可视可管。它要能供给 AI 训练的语料、能形成知识储备、能快速检索;同时AI推理产生的新数据也要存下来,形成数据飞轮。如果没有数据底座,所有的数据都是散乱的、无法管理的。

有了这架构,企业才能够良性、有序地落地 AI,把 AI 真正放到生产环境去运行。袁远说。

这个参考架构也并非简单堆砌,而是一张沿着数据主线展开的全栈建设蓝图。从数据入湖、知识沉淀、算力调度、模型部署到智能体运行,覆盖了 AI 全生命周期。

但要真正理解这张设计图的价值,仅仅看到它是什么还不够。还需要回答一个更根本的问题:为什么是现在?为什么是这五层?为什么是华为率先提出?

打开网易新闻 查看精彩图片

AI 基建进入 3.0 时代

放在整个产业基建演进周期中看,华为选择在当下抛出这套参考架构,实际上精准踩中了 AI 基础设施迈入 3.0 时代的关键拐点。

AI 基础设施至今已经历了两代演进。第一代是传统数据中心。核心使命是支撑企业业务系统运行。服务器、存储、网络各司其职,追求的是稳定、可靠、不出错。它的设计围绕业务流程展开——ERP 要稳、OA 要快、数据库要准。数据只是业务流程的副产品,存下来以备查询即可。第二代是智算中心。 随着大模型兴起,企业开始意识到算力的战略价值。智算中心的核心使命是支撑大模型训练,一切设计围绕“算力扩张”展开——GPU 集群的规模、HBM 的带宽、万卡乃至十万卡的扩展能力。

而今天,产业正在进入第三代——以数据为中心的 AI 基础设施时代。

这一判断建立在两个正在发生的结构性变化之上。其一,据 IDC 统计,当前全球已有超过 3000 万个活跃智能体为人类工作,而这一数字将在 5 年内飙升至22 亿。这意味着,未来企业的组织架构将被彻底颠覆,“一人加一个智能体就等于一家公司”将不再是天方夜谭。其二,词元(Token)正在成为一种全新的数字流通凭证。IDC 预计 2026 年全年 Token 消耗量约为 40,000 万亿,较 2025 年进一步增长约 20 倍。摩根大通预测,中国 AI 推理 Token 消耗量将 from 2025 年的约 10 千万亿增长至 2030 年的约 3900 千万亿,五年增长约 370 倍。词元未来会成为像空气和水一样的基础性资源。”袁远强调。

正是在这个背景下,华为提出了构建以数据为中心的 AI DC 数据基础设施参考架构。它不再以算力或存储为单一核心,而是以数据为贯穿主线,原生适配从数据准备、知识沉淀到智能体落地的全生命周期,标志着AI基建正式从算力导向进入数据价值导向的新阶段。

打开网易新闻 查看精彩图片

华为一口气亮出了 5 张底牌

那么,围绕这套参考架构,华为有哪些核心底牌?

袁远表示,面对企业在 AI 落地时的重重壁垒,单点突破的技术已经无济于事。基于对企业痛点的深刻剖析,华为在本次论坛上正式亮出了 AI DC 数据基础设施全栈方案。

打开网易新闻 查看精彩图片

数据准备阶段,华为 AI 数据湖解决方案 OceanStor Pacific 全闪分布式存储为底座,实现 11PB/2U 的业界领先高容量密度,100PB 数据存储空间从15 个机柜缩减至 1 个机柜。DME Omni-Dataverse 提供统一数据空间,支持千亿千维向量数据秒级检索,打通跨域多模数据实时入湖,让企业数据真正"应入尽入"。

推理阶段,华为推出业界首个面向超大规模数据中心、支持异构算力的上下文记忆存储 CMS,通过 KV 语义硬化和 NDS 直通技术实现数据一跳直达 NPU片上内存,推理首 Token 时延降低 90%,每 Token 成本降低 30%。同时推出业界首个"3+1"AI 数据平台,整合知识库、KV Cache 库和记忆库,由 UCM推理记忆数据管理技术统一调度,整体提升推理准确率 30%,提供OceanStor A800 存算一体与 OceanStor Dorado 搭配数据引擎节点两种部署形态。

模型工程阶段ModelEngine 一站式 AI 工具链支持 30 多种模型开箱即用、零代码适配新模型,AI 容器 eContainer 支持 NPU/GPU 最大 1:10 细粒度切分和 HBM/DRAM 内存模型的放入放出,智算集群 GPU 利用率提升 30%以上。

智能体开发阶段ModelEngine Nexent 智能体平台支持通过自然语言直接生成智能体,上线周期缩短 80% 以上,并内置 Skill、提示词、记忆的自动优化能力,让智能体越用越聪明。

数据安全方面则是这套架构的地基。AI时代,数据一旦被投毒或篡改,后果不堪设想。袁远反复强调:"全栈安全的根本,在于解决数据本身的安全。"因此,华为构建了涵盖防滥用、防投毒、防篡改、防勒索的端到端数据保护方案。

此外,华为不仅在用数据基础设施支撑 AI,也在用 AI 反哺存储自身的运维。 本届论坛发布的 DataMaster 存储运维智能体,可以通过自然语言交互完成复杂的运维操作,提前识别 60% 的性能恶化及业务中断类问题,复杂故障恢复时间严控在 30 分钟以内。当 AI 开始管理 AI 的基础设施,整个体系才真正进入自我进化的正循环。

简言之,算力支撑模型,模型驱动智能体,智能体反过来优化基础设施。数据飞轮,正在整个体系中转动起来。

打开网易新闻 查看精彩图片

AI的下一程,在数据

当然,数据飞轮转动起来,靠的不仅是一套架构,更是一套完整的产业能力。

在行业落地的纵深上,这条路径已被反复验证。以本次论坛所在地江苏为例:华为扎根 20 余年,南京和苏州建立了两大研究所。金融领域,江苏 70% 以上金融客户使用华为存储,苏州农商行率先完成存算分离改造,性能提升超 40%。医疗领域,70% 头部医院选择华为,暨南大学附属第一医院将单个病人诊断时间从 45 分钟缩短到 10 分钟。教育领域,鹏城云脑III登顶 IO500 双榜十二连冠。从金融到医疗、从科研到制造,千行百业的实践正在拼出一幅完整的落地版图。

显然,当 AI 从实验室走进生产环境,从对话工具变成数字员工,数据的管、存、用能力,已经成为衡量企业 AI 成熟度的新标尺。

AI DC 数据基础设施参考架构的价值,正在于此——它第一次为企业提供了一张从数据入湖到智能体运行的全屋设计图,让千行百业不必从零摸索、重复造轮子,而是有章可循、逐层构建。这不仅是华为的技术主张,更是对智能体时代基础设施标准化的一次关键定义。

AI 的下一程,在数据。而数据的下一程,需要一个能贯穿数据全生命周期的基础设施底座。正如袁远在演讲最后所说的:算力、模型、智能体这三个AI发展章节已经先后上演,而真正决定企业AI竞争力高下的下一章,属于数据。”而华为闪存存储领域副总裁刘君在演讲最后同样点明——“高质量的数据集以及高精度的知识,将成为 AI 智能体在各行各业高效、高质量落地的关键。”