最近在算力圈子里面,正在发生一件很有意思的变化。很长一段时间,只要大家聊到液冷,第一反应都会想到硬件厂商。浪潮、英维克这些企业,做服务器、做温控设备,常年占据着大家的视线。在很多人的固有印象里面,液冷这条赛道,头部位置理所应当会被设备制造企业拿下。
但从最近行业落地的实际情况来看,格局已经悄悄变了。润泽科技没有对外大规模销售液冷硬件产品,而是以算力园区运营者的身份,靠着整栋大规模纯液冷智算中心的建成投运,在第三方液冷智算运营这个细分赛道走到了行业最前面。这件事,也让不少业内人士重新思考,液冷产业的竞争,到底拼的是什么。
很多人没分清:卖设备的厂商,和运营机房的运营商,根本不是一回事
大部分普通读者,很容易把液冷整条产业链混在一起看,觉得做液冷的企业都在同一个赛道里比拼。其实拆开来看,上下游的业务逻辑差别非常大。
浪潮、英维克这类企业处在产业链的上游,核心工作是研发、生产液冷服务器、散热机组、液冷零部件,把成品卖给各大数据中心,简单理解就是生产并且卖出散热工具。润泽科技的定位完全不同,它并不以售卖液冷硬件作为主要收入来源,而是把液冷整套技术用在自己投资、建设、长期运营的智算园区当中,属于技术的大规模落地使用者。
一个是“造铲子卖铲子”,一个是“买下铲子,自己开挖矿区”。二者虽然都身处液冷大产业当中,评价标准、竞争方向完全不一样。设备厂商比拼的是零部件性能、产品出货量;算力运营商比拼的是园区规划、工程落地、上万台服务器长期稳定运行的能力。
正是这个认知上的差异,让很多人刚听到消息的时候会感到意外:一家不卖液冷设备的公司,怎么会在液冷赛道脱颖而出。
从试点到整栋落地,用两年多时间跑通纯液冷运营模式
时间回到2023年,润泽科技落地了国内较早的整栋式纯液冷智算中心。放在当时的行业环境下,绝大多数数据中心,依旧以风冷散热为主,顶多拿出一小部分机柜,小范围测试液冷方案。整栋大楼从设计之初,就全部按照液冷标准去建造,在业内属于步子迈得比较大的尝试。
那个阶段,行业里观望的声音不少。大家心里都有疑问:整栋大楼上万机柜全部走液冷,后期运维会不会很难?冷却液管路长期运行会不会有隐患?整体成本能不能控制在合理区间?很多企业都在等着看第一批大规模项目的实际运行结果,不敢贸然跟进。
一晃两年多过去,这套全液冷的运营模式,已经经过长时间真实业务的检验,各个环节不断打磨优化。它采用冷板式液冷路线,单机柜可以稳定承载45千瓦以上的高功率负载,部分机柜最高可以做到70千瓦,刚好匹配当下大模型训练,对于高功耗GPU集群的部署需求 。
在能耗指标上,园区最低PUE可以做到1.15,远低于国内新建大型数据中心1.3的管控基准,节能效果实实在在。到目前,润泽旗下已经有8座算力中心入选国家绿色数据中心名录,也是对它绿色算力建设成果的官方认可。
廊坊的单体200MW全液冷智算中心,在今年上半年已经进入投产阶段,规划3.2万架高功率机柜,全部建成之后,可以承载十几万张AI加速卡,用来支撑大模型的训练与推理,客户以头部互联网、AI企业为主,长周期订单占比较高,业务的稳定性较强。
液冷从可选变成刚需,背后是两层现实压力
很多平时不接触算力行业的朋友会疑惑,为什么短短两三年时间,液冷突然从一个锦上添花的技术,变成新建智算中心的主流选择。这里其实有两层很现实的原因。
第一层来自硬件本身。现在大模型越做越大,AI服务器的功耗一路往上走。一台满载运行的高性能服务器,发热量十分惊人。传统依靠空调吹风的风冷模式,已经摸到了物理天花板。如果强行在风冷机房里面堆高功率服务器,很容易出现局部温度过高,服务器降频、甚至意外停机,同时制冷耗电会大幅上涨,运营成本居高不下。
第二层来自产业发展对于绿色低碳的要求。各地对于新建大型算力基础设施,在能耗指标上面都有明确约束。如果还完全依靠风冷,很难达到最新的能效审核标准。一边是算力硬件功耗越来越高,一边是节能降碳的硬性导向,两股力量叠加在一起,液冷就从“可选项”,慢慢变成了高功率智算中心的“必选项”。
在这个趋势之下,不少传统机房选择在原有建筑里面,局部加装液冷设备做改造。润泽走了另外一条路,从园区最开始的规划阶段,就把全液冷作为底层标准,建筑结构、供电管线、运维通道全部围绕液冷来配套,不用在建好的大楼里面修补改造,这也是它和很多存量机房最大的区别。
最大的难点不在买设备,而在整套大规模运维体系的搭建
很多人会觉得,做全液冷机房,无非就是花钱采购一批液冷硬件,安装到机柜里面就算完工。真正做过工程的人都清楚,事情远没有这么简单。
一栋几十万平米的智算园区,上万台液冷服务器同时运行。冷却液输送、管路密封、水质实时管控、漏液预警、日常巡检维修,任何一个细小环节出问题,都有可能造成大范围业务中断。市面上可以买到成熟的液冷硬件产品,但是适配十几万张算力卡规模的调度标准、故障预判流程、应急处置方案,没有长时间的真实场景打磨,是很难成型的。
润泽没有直接照搬外部现成方案,而是结合国内AI算力运行的实际场景,持续迭代冷板式液冷的落地细节,搭建起一整套从水质监测、管路AI巡检、异常提前预警,到故障快速处置的运营体系。尽量做到隐患提前发现、前置处理,减少集群停机的概率。
在布局节奏上,它没有把所有筹码放在单一地区,而是在京津冀、长三角、粤港澳、成渝等数字经济活跃的区域,布局了七大境内智算集群。不同区域的算力园区,可以面向本地企业就近提供算力服务,降低网络延迟,也能分散区域用电、市场环境变化带来的经营风险。
从财报变化,能看到算力行业正在发生的结构性转变
今年8月底发布的最新半年报,给出了一个很有标志性的数据:润泽科技AIDC也就是AI算力业务的收入占比,已经正式超过传统IDC托管业务,成为公司第一大收入来源。AIDC业务上半年营收接近20亿元,同比增长126.24%,占总营收比重达到53.26% 。
这个变化,不只是一家企业内部业务的切换,它折射出整个市场的真实需求。前几年AI算力还处在概念阶段,订单零散、不确定性高。而到现在,越来越多企业有常态化训练、推理的算力需求,愿意签订长期托管合约,高密度液冷算力的市场需求实实在在释放出来。
这里也要客观把边界讲清楚:润泽科技的领先,是在第三方运营、大规模纯液冷智算交付运营这个细分领域规模靠前,并不代表它在液冷设备制造层面,已经超过硬件厂商。硬件厂商的赛道是零部件研发与产品供货,运营商的赛道是算力园区建设与长期托管,两条赛道不存在直接的替代关系,都是产业链里面不可缺少的一环。
算力产业的价值重心,正在从硬件向基础设施运营迁移
往前推几年,整个市场讨论算力,焦点几乎全部集中在芯片、服务器硬件上面。大家默认,硬件就是整条产业链价值的核心。随着行业慢慢走向成熟,市场的认知也在更新。
买完服务器,不等于算力就可以稳定使用。上万张算力卡集群能不能7×24小时不间断跑起来,机房供电稳不稳定,散热方案能不能长期可靠,网络传输延迟能不能达标,电费、运维成本能不能控制,全部都会直接影响最终的使用效果。硬件只是基础,算力基础设施的建设运营,正在变成壁垒越来越高的环节。
放在更大的产业视角来看,数字经济的发展,既需要上游企业不断做好软硬件技术攻关,也需要靠谱的运营主体,把算力资源落地,服务各行各业的数字化升级。液冷技术大范围推广,本质是用技术手段,在扩大算力供给的同时,控制能源消耗,实现算力建设和节能降耗并行,契合产业高质量发展的大方向。
当然,赛道前景向好,不等于没有挑战。现在国内不少企业都在加码液冷智算中心建设,后续市场竞争会进一步加剧。液冷大规模商业化落地的时间不算很长,行业统一标准还在持续完善,专业运维人才缺口、长期成本优化,依然是整个行业共同面对的课题。未来新建智算中心里面,液冷的占比大概率会持续走高,高密度、绿色、稳定可靠,已经成为算力建设的主流方向。
过去很长一段时间,新基建市场里面,硬件企业层出不穷,但是有能力承接超大型算力项目、并且长期稳定运营的主体并不算多。润泽科技的发展路径,也给行业提供了一个参考样本:除了硬件研发之外,从园区顶层规划入手,吃透散热、供电、运维整套体系,同样可以建立起自己的核心竞争力。液冷赛道的比拼,已经从单纯硬件产品竞争,升级到整体方案、大规模交付、长期运营能力的综合较量。
免责声明:本文仅为产业现象客观解读,不构成任何商业与投资建议,文中数据均来自公开披露信息,行业发展存在不确定性,请理性看待。
热门跟贴