你点开AI助手,花了五分钟和它聊了会儿天。就在这五分钟里,远在千里之外的一座智算中心,为了处理你的语音识别、语义理解和答案生成,悄悄“喝”掉了一瓶500毫升的矿泉水。
很多人以为,和AI互动只是消耗一点电、占用一点网。实际上,每一次看似轻盈的答案跳动,背后都是以水、电、芯片为代价的真实物理世界。过去我们说“云计算”,那只是打了个比方。但AI时代的云,是真的在把水变成云——变成冷却塔上方飘散的水蒸气。
智算中心的机房,是真正意义上的“热锅”。里面挤满了成千上万颗GPU芯片,单颗芯片的功耗可以轻松突破700瓦,大致相当于一台微波炉或者一百部手机在持续运转。当一个机柜塞满这样的芯片、满负荷昼夜奔跑时,峰值功率能冲到140千瓦,芯片局部温度极短时间内就会飙过85摄氏度。这不是降速卡顿的问题,而是稍有不慎就会直接烧毁。
于是降温就成了硬刚需。而降温的方法,目前主要就是三种。第一种是最传统的风冷,简单讲就是电扇对着吹,把热空气赶走、把冷空气引进来。成本低,安装快,但散热效率也低得惊人,只适合早期低算力的小机房。第二种听起来很酷——浸没式液冷,把整个设备泡在特种绝缘冷却液里,散热效率极高。问题是,这套系统本身贵得离谱,冷却液也是高价消耗品,普及起来难。于是,板式液冷成了当下的最优解:让冷却液通过金属板带走热量,电子元件本身不接触液体,在效率和成本之间取了一个巧妙的平衡。
搞清楚降温原理之后,AI的“水费单”就更具象了。耗水最凶的阶段,并不是你提问的那几秒,而是前期的模型训练。大模型训练需要数万亿个参数在海量文本、图片和视频数据上反复调整,动辄要调动数千甚至上万块GPU,一连跑上数周到数月。这期间,冷却系统必须一刻不停地满负荷运转。当年训练GPT-4的算力集群,总耗水量高达1.89万吨。什么概念?相当于国内5000个居民整整一个月的用水总量。
前期的大水漫灌式烧水之后,就是日复一日的细水长流。你现在调用已经训练好的模型进行单次推理,用水量其实很小。研究人员测算过,进行一次约五分钟的AI语音对话,在智算中心里累积消耗的冷却水大约是500毫升,刚好一瓶矿泉水的量。但问题在于,AI应用的用户量动辄用千万甚至亿来计数,一瓶又一瓶矿泉水汇到一起,就变成了一股洪流。一座稳定运行的大型AI智算中心,年耗水量轻易可达数百万吨。而一个中等城市所有家庭每天的用水量,不过几十万吨。换句话说,一座智算中心相当于给这座城市额外增加了一个社区的水务负担。把尺度再拉大一点看,全球AI算力基础设施每年的耗水总量,已经逼近爱尔兰全国居民的全年生活用水量。
更要命的是,这些被喝掉的水,有相当一部分是收不回来的。现在主流的智算中心普遍采用两级水冷结构。第一级是紧贴机柜的闭式循环水路,在内部循环为芯片散热,水量损耗极少。真正耗水的是第二级系统——它负责把一级系统的热量搬运出来,做最终的散热释放。在这一步,绝大部分水在冷却塔里直接被蒸发飘散,根本无法回收循环。如果把眼光从冷却系统本身再往外扩一些,AI“喝”掉的水远不止这些。冷却系统自己也要耗电:水泵需要把水送进管道,风机需要制造气流,制冷设备还得不断调节温度。这些辅助设备的耗电量,通常占智算中心总用电量的15%到25%。而电力生产本身,同样是一座巨大的隐形水塔。不管是火电、水电还是核电,大规模发电系统都与水资源深度绑定。好比说,江西省最大的水电站万安水电,其全年的发电量也只够满足两座超大型智算中心的使用。再算上芯片制造、机房设备清洗、中水预处理、污水净化这一连串上下游环节,AI那个看似轻盈的虚拟交互界面,背靠的其实是一张庞大又切实的水资源消耗网络。
那么,这些越来越渴的AI,到底该去哪儿找水喝?我国的算力布局,正在上演一场典型的东西部水资源博弈。东部地区城市密集、企业扎堆,算力需求最旺盛,但土地紧张、电价高昂、水资源本身也不宽裕。现在东部地区已经严禁新建高耗水的开式冷却塔算力项目,同时在强制性推广中水回用、闭式冷却与浸没液冷技术。比如南宁、广州的一些智算产业园,已有近一半的冷却水来自市政再生中水。而在西部地区,水电资源丰富、水源充沛,加上气候干燥凉爽,自然冷却效率高出一个台阶,成本也低。于是“东数西算”工程才应运而生。如果把全国智算中心网络看作一台巨型发动机,那么东部负责踩下算力需求的油门,西部就负责提供能源和散热的那一部分。贵州贵安、内蒙古和林格尔、甘肃庆阳等西部区域早已建起算力枢纽,专门承接离线计算和大模型训练这类任务。
但西部也并不是完美无缺的应许之地。冷却系统对水质的要求极高,需要的是纯净度足够的软化水,而西部部分区域水质本来就偏硬,处理成本反而上去了。再加上高原地区蒸发量本就比平原大,冷却塔的水损耗也就跟着水涨船高,并没有想象中那么划算。
那么,能不能从根本上让AI少喝点水?让大家集体减少AI的使用,显然不现实。更有价值的思路,是从源头上压缩AI本身的产热规模。比如用低功耗先进制程的GPU,配合分布式轻量化推理模型,让算力从一开始就不产那么多热源。更省电的芯片和更高效的算法,也在改变AI对水资源的依赖模式。研究人员已在尝试神经形态芯片,模拟人脑神经元的工作方式,功耗仅为传统芯片的千分之一。还有光子计算,用光而非电来传输信息,几乎不产生热量。如果这些技术路线能跑通并走向成熟,AI确实有可能进化成一种“只动脑、不流汗”的理想形态。与此同时,在冷却端也有不少低能耗替代方案在往前推进,包括密闭两相浸没液冷、海水冷却海底数据中心,以及余热制冷技术。在工业生态内部,还可以通过能量的梯级循环来降低整体消耗。举例来说,火电机组为算力中心供电时,其发电余热可以被用来驱动制冷机;算力中心周边的钢铁、化工企业排放的余热,也能被接入制冷循环。更进一步,可以让工业余热先发一轮电,剩余热量再依次拿去给数据中心制冷、给建筑供暖、给温室供热,一层一层把能量榨到极致。欧洲已有多个算力中心实现了余热接入城市热网的实践。
当然,AI并不会真的把地球上的水喝光。相比于工业和农业这些核心耗水部门,它的用水量目前仍然只是全球用水大盘中的一部分。但这个急速膨胀的新玩家也清楚地提醒我们一件事:数字世界从未真正脱离物理世界的法则而存在。我们期待模型更大、算力更强,但与此对应的,是期待它用每一滴水、每一度电换来更实在的价值。
热门跟贴