国产GPU首次进入头部云厂商的十万卡级智算集群,这件事在圈内引发了不少讨论。
十万卡集群到底难在哪?中国工程院院士郑纬民有个判断:十万卡连在一块,平均一个小时要出一次错。这背后是三道硬坎——互联网络、供电散热、调度运维。
互联网络是第一道坎。传统单机八卡服务器在面对超万亿参数模型时,集群通信开销过大,算力线性增长受阻。卡越多,互相“说话”的成本越高。国产GPU厂商正在推进高密超节点设计,在标准机柜内实现更多卡的全互联。
供电与散热是第二道坎。单颗GPU功耗已突破 700W,机柜功率向350kW演进。高密度算力对散热系统提出了更高要求,PUE控制成为数据中心设计的核心指标之一。
调度与运维是第三道坎。十万张卡协同工作,需要一套极其复杂的软件栈来调度。哪张卡闲着、哪张卡过热、哪个任务优先,全靠调度平台指挥。
十万张GPU需要一栋专门设计的建筑来承载——能扛住超高功率密度、能提供毫秒级网络响应、能把PUE压到极致。
芯片厂商解决“GPU能不能用”,而“十万张卡往哪儿放、怎么让它们稳定跑起来”,是另一批玩家的事。
尚航科技研发中心总经理饶云飞曾在其题为《算力经济的效率账》的演讲中提出一个判断:算力竞争正从资源规模转向有效产出。他强调,AIDC并非IDC的简单扩容,而是算力、电力、制冷、网络与运维的系统性协同,其核心在于提升单位有效算力的全生命周期效率。
一个核心公式:单位有效算力成本=全生命周期总成本/有效算力产出。
这个公式拆开来看,有效算力产出由装机规模、上架率、利用率、可用性及任务效率共同决定;而总成本则涵盖了从设备投入、长期运行的电力制冷,到网络存储、故障损失、交付等待及运营管理等所有环节。
换句话说,十万卡集群的账,不是“买了多少张卡”的账,而是“这些卡最终产出了多少有效算力”的账。规模上去了,上架率、利用率、可用性跟不上,单位成本反而可能更高。
以怀来尚云智算中心为例,这个项目在规划之初就瞄准了十万卡级集群的技术需求:IT容量设计100MW,可容纳十万块AI算力芯片。
能源侧,怀来尚云直接切入了张家口国家级可再生能源示范区的绿电资源。项目所在地年均气温仅9.1℃,叠加当地风电、光电的清洁能源优势。对于动辄消耗数十兆瓦电力的十万卡集群来说,电费是运营成本的大头,绿电直供意味着从源头上降低了用能成本。
散热侧,怀来尚云采用风冷方案。得益于项目当地环境优势,全年大部分时间可直接利用室外冷空气进行散热。这套方案的核心逻辑是:充分利用怀来的气候优势,让自然冷源承担主要散热任务,减少机械制冷的使用时长。通过功率动态调节和风冷系统的优化设计,PUE值控制在1.25以下。
对中小企业来说,这件事的意义在于算力成本下行的可能性。国产GPU规模化商用的直接结果,是供给增加、价格松动。而“便宜”从哪来?一部分来自国产 GPU的性价比优势,另一部分来自智算中心的技术降本能力——绿电直供降低电费,风冷方案降低运维成本,PUE压到行业领先水平,省下来的成本最终会传导到算力租用价格上。
郑纬民院士说,国产集群第一步是先做到能用,然后才是好用。从技术验证到规模化商用,第一步已经迈出去了。
对国产算力来说,能让这十万张卡长期、稳定、高效地跑下去才是真的考验。这需要的是从芯片到机房、从供电到运维的全链条协同。怀来尚云这类项目的意义,也正在于此——它提供的不是一个简单的机房,而是一套让国产算力从“能跑”变成“跑得划算”的系统性解法。
广州尚航信息科技股份有限公司(尚航科技,NEEQ:873374)成立于2010年,是一家专注于智算中心(AIDC)、AI算力和云综合服务的基础设施服务商。面向人工智能、云计算、大数据、车联网等产业,尚航科技致力于为客户提供全球领先、最可靠的智算基础设施服务。
热门跟贴