一周前,郑州,中国首个全国产十万卡AI超集群曙光8000正式落成,同步接入国家超算互联网;一周后,上海,WAIC 2026展馆内,这尊十万卡大家伙首次亮相,就被“抢光”算力。
数据显示,集群上线首周即实现满负荷运转,日均处理作业数突破15万个,单日峰值超过50万个。当十万卡算力起跑线刷新,曙光8000在算力规模化应用中,再次踏出关键一步。
AI应用大爆发,算力引擎必须跟上
本届WAIC上,AI的产业化落地色彩,前所未有地浓厚。
1100余家企业参展,3000余款展品亮相,超300款产品全球首发。行业智能体已渗透办公、教育、出海、零售等场景;具身智能从“单兵作战”走向“团队协作”;算力基础设施从后台走向前台,成为展览的硬核主线。
这一切变化背后,有一个共同的驱动力:Token需求呈指数级增长。
中国信通院副院长魏亮在会上披露了一组关键数据:我国日均Token调用量已从2024年初的约1000亿,飙升到2026年3月底的140万亿,增长超过千倍。智能体时代,一个用户指令可能触发多轮模型调用和资源消耗。从对话走向操作,Token消耗放大10到100倍。
Token调用量翻了一千多倍,算力基础设施也必须同步跃升。国产算力挺进十万卡赛道,不是选择,是必然。而在这场规模竞赛中,曙光8000率先撞线,原因不仅在于单点芯片性能参数,更在于积淀深厚的系统工程能力。
算得快,更要“跑得稳、跑得满”
十万卡集群,算力规模是万卡的十倍,系统复杂度却是指数级上升。单点芯片再强,如果网络拥堵、存储跟不上、散热撑不住、调度管不过来,最终都可能变成跑不满的“纸面算力”。
单是十万卡的系统建设,都要跨越很多道坎。中科曙光高端计算总工程师卜景德向媒体透露了一个惊人的数字:曙光8000整个系统有30亿个器件精密协同,末端的安装精度达到毫米级。这意味着,背后的架构设计和工程化,均要挑战极限。
中科曙光北京公司副总裁李柳从另一个角度解释了难度所在:未来万卡、十万卡集群可能是常态,每一次计算失败背后都是巨大的成本损耗,“未来每算一次,我们争取一次性算成功”。规模扩大后,故障率恢复时间都是指数级增长,高可靠性是比高带宽、低延迟更重要的指标。
总体来看,十万卡集群的竞争,本质上是“存算网”协同的系统工程能力之争。网络、存储、散热、调度等关节,决定了集群的实际算力输出能打多少折扣。
官方信息显示,曙光拥有“芯片、计算、存储、网络、散热、应用、服务”全链路全自研AI基础设施能力:
· 自研scaleFabric类IB原生RDMA高速网络,采用信用基流控保障无损传输,毫秒级链路故障恢复能力不随规模衰减;
· ParaStor分布式存储斩获2026全球IO500双榜第一,解决了十万卡并发场景下的数据吞吐瓶颈;
· 浸没式相变液冷技术支撑单机柜MW级功率密度部署,PUE低至1.04,为十万卡持续稳定运行提供了散热底线;
· Gridview 7.0一站式智能化算力管理平台,让十万张卡“像一台计算机一样高效工作”。
算力规模化落地,命中核心场景需求
大规模算力集群的最终命题,必须落进AI应用场景核心需求。曙光8000一周内满载运行,验证的正是它的“命中率”——算力供给与真实场景需求之间的匹配程度。匹配度越高,集群利用率越高;匹配度不够,再大的算力规模也是浪费。
中国工程院院士李国杰指出,当前,AI应用催生的算力需求不再是单一精度计算,而是需要同时支持高精度科学计算和低精度AI训练的超智融合能力,要求计算系统在架构、规模、能效和可靠性上实现系统级创新。
曙光8000采用的原生超智融合技术路线,正是对这一趋势的精准回应。该集群摒弃传统分区方式,支持FP64到INT8全精度计算,一套系统覆盖科学计算、大模型训练、AI推理、工业仿真等多类场景,从根本上解决了科研和产业用户“跨系统倒腾数据”的效率损耗。
目前,曙光8000已完成近千项超智融合应用适配,覆盖大模型训练、高通量推理、科学计算等多个万卡级规模场景。其中,超过70个应用实现万卡规模扩展,涵盖大模型、机器人、创新药、新材料、量子计算、天文气象等二十余个领域。
从十万卡落成到满负载运行,从工程交付到价值兑现。曙光8000踏出的这一步,不仅刷新了国产算力基建规模的起跑线,同时也为十万卡集群如何真正服务于产业提供了关键样本。“从零到一”的突破已经完成,下一步落进千行百业AI场景深处,也不远了。
热门跟贴