打开网易新闻 查看精彩图片

近日,中科曙光曙光8000(登峰)落地。这被业界视为国内首个全国产十万卡AI超算集群,其核心不只是“十万卡”这几个字,而是把芯片、计算、存储、高速网络和浸没式相变液冷放在同一套系统中验证。对通信行业而言,这一事件的看点在于:当AI算力从千卡、万卡走向十万卡,竞争焦点正从单颗加速卡转向集群系统工程,网络、散热、存储和调度能力开始决定算力能否真正释放。

十万卡时代,瓶颈不只在芯片

过去衡量智算中心,常看加速卡数量和峰值算力。但十万卡规模下,芯片功率密度大幅抬升,传统风冷和冷板散热逐步逼近物理上限。高温带来的降频、稳定性下降,会让理论算力在长时训练中打折。曙光8000把浸没式相变液冷作为核心方案,说明散热已从机房配套升级为集群设计的前置条件。液冷是否可靠,直接关系到国产高算力芯片能否持续满负荷运行。

浸没式相变液冷:从“可选优化”到“基础设施底座”

从已披露方案看,曙光8000把计算卡、主板等部件直接浸入绝缘冷却液,利用受热沸腾相变快速带走热量,再通过闭环循环完成换热。相比传统风冷,这种方案的散热密度显著提升,可压缩机房占地,整机能耗降低约40%,集群PUE低至1.04。这组数字的意义在于,十万卡高密度部署下,持续温控不再是局部问题,而是影响TCO、供电容量、机房利用率和碳排指标的系统问题。

对通信运营商和第三方IDC而言,液冷路线正在改变智算中心的设计逻辑。高密机柜、液冷管路、冷却液循环、漏液监测、材料兼容性和运维规范,都需要在建设初期纳入。PUE低至1.04,意味着冷却系统接近极限效率,也意味着IT设备、供电和冷却必须协同设计。在国产超大规模AI集群的工程语境里,液冷已从优化项变为底座能力。

全链路国产自主:高速网络和存储是隐形主角

曙光8000的另一层价值,是实现从加速芯片、整机计算、存储到高速网络的全链路国产自主可控。集群采用超智融合架构,兼顾AI大模型训练推理与高精度科学计算,并搭载自研scaleFabric高速网络与高性能分布式存储。对通信行业来说,这部分尤其值得关注:十万卡集群中,参数同步、梯度聚合、检查点写入和推理请求分发,都会形成大规模并行通信。网络拥塞、尾延迟和故障恢复能力,直接影响算力利用率。

在万卡以下,部分问题可以靠堆带宽和调优掩盖;到了十万卡级别,网络拓扑、拥塞控制、集合通信库、存储I/O和任务调度必须协同优化。自研高速网络与分布式存储的组合,意味着国产集群不能只解决“算得快”,还要解决“传得稳、存得进、调得动”。这也是通信设备商、光模块厂商、交换芯片企业和云网服务商的新机会窗口。

接入国家超算互联网:算力网络需要通信级确定性

曙光8000已接入国家超算互联网,并适配新材料、生物医药、气象仿真等AI for Science场景。这类场景与互联网大模型训练不同,往往对精度、稳定性和数据吞吐有更高要求。国家超算互联网的目标,是推动超算、智算资源互联互通和统一调度。超大集群接入后,算力不再是一座孤岛,而可能成为全国算力网络中的重节点。

这对通信网络提出更高要求。算力调度需要低时延、大带宽、确定性和安全隔离;跨地域训练与推理需要DCI、全光交换、SRv6、算力路由等能力配合。过去通信网主要解决人与人、人与信息的连接,未来还要解决算力与算力、模型与数据、训练与推理之间的高效连接。十万卡集群落地,实际上把“算网融合”从概念推向了工程验证阶段。

产业影响:液冷、光互连与算网融合迎来工程化窗口

从产业格局看,全球AI算力竞赛正在从单卡性能转向集群规模。海外头部厂商依靠GPU、互连协议和软件生态形成紧耦合体系,中国厂商则必须走通芯片、网络、存储、液冷、操作系统和调度平台协同的路径。曙光8000登峰的意义,在于验证国产算力硬件的大规模协同能力,也证明自研浸没相变液冷可以支撑十万卡级超大规模智算工程。

对通信产业而言,至少有三条影响链条值得跟踪。第一,液冷与高密机房将带动冷却液、管路、传感器、监控和运维服务市场;第二,十万卡集群内部互连将拉升高速光模块、交换机和光纤连接需求,并推动国产高速网络协议与软件栈成熟;第三,国家超算互联网和“东数西算”体系需要更强的算力调度与网络编排能力,运营商和通信设备商将从“连接提供者”进一步转向“算网服务提供者”。

曙光8000(登峰)落地,不只是一次算力规模刷新。它把国产AI集群的竞争拉到了系统层:液冷决定能否稳定运行,高速网络决定算力利用效率,存储和调度决定大规模任务能否持续,国家超算互联网则决定这些算力能否被更广泛地调用。十万卡之后,更大规模国产算力集群仍将面临能耗、可靠性、软件生态和标准开放等挑战。但可复制的工程样本一旦形成,国产算力底座和算力网络的下一阶段扩张,就有了更现实的起点。