过去两年行业瓶颈在于芯片,未来五年被卡住脖子的,可能是电力。
这两天很少有人注意到一个数字。
9月16日,中国电力企业联合会公布了一组数据:今年全国互联网数据服务业用电量达到600亿千瓦时以上,比2025年增长了四成以上,远远高于2024年的全年水平。
— 风光就地发电 + 数据中心柔性调度:算力正在变成电网的一部分
01
DATA
600亿千瓦时的分量
一年不到的时间,就消耗完了全年所有的电量。
同一份数据中还有一句话:全国日均Token调用量,比两年前涨了一千倍。Token的中文名字叫做词元,它是大模型运算的基本单位,你输入的每一个字、模型输出的每一句话,都要被拆分成词元才能运行。
调用量增加了一千倍,电表也随之加速转。
「一个百万人口的中等城市,一年居民生活用电量大约是几十亿千瓦时。」
600亿千瓦时是怎样的一个概念?一个百万人口的中等城市一年居民生活用电量大约是几十亿千瓦时。600亿千瓦时,差不多就是十几座这样的城市,一年只做一件事情——给机房供电。
而且曲线还在继续上升。今年上半年,互联网数据服务行业的用电量已经接近了2024年的全年水平。
02
SHIFT
从上学到上班
中电联指出,人工智能正由“训练为主”向“训练和推理并重”转变。
两者的区别很大。训练就是大模型的上学阶段,一次投入,跑完就算结束;而推理则是它的上班阶段,每次使用都要计算一次,全年不停。一个公司搞训练,可能会在几个月内集中消耗掉大量的电量;几亿人每天都在使用,那就不是涓涓细流,而是一条大河。
01
训练
一次投入,跑完即止
N
推理
每次使用都算一次,全年不停
中电联监事长潘跃龙给出的预测是:预计“十五五”期间,全国算力用电量年均新增1000亿千瓦时以上,到2030年将达到8000亿千瓦时,占全社会用电量的6%左右。
6%,相当于给全国凭空添了一个省级用电大户。
03
BOTTLENECK
为什么英伟达要拉上电网
同一天,英伟达、谷歌以及一家叫做Emerald AI的公司一起成立了“AI能源管理联盟”。因为电力供应已经成为限制部分地区AI基础设施扩展的主要瓶颈。
过去两年里,大家讨论人工智能瓶颈的时候都是在谈论芯片。但是芯片问题可以通过产能堆积来解决,建厂、扩产,几年之后总会补回来。
电不行。从申请电力接入、变电站扩容到完成并网,整个过程一般需要五年到七年的时间。英伟达下一代平台已经迭代了好几轮了,但是机房还在排队。因此有些算力项目最昂贵的成本并不是那几万块GPU,而是等待的时间成本。
这就是为什么该联盟要做一件听起来很奇怪的事情:把数据中心由“需要电力”的东西变成“电网的一部分”。
「有些算力项目最昂贵的成本并不是那几万块GPU,而是等待的时间成本。」
04
SOFTWARE
算力学会给自己踩刹车
方法就是安装一个调度软件。电网紧张的时候,它会暂停非实时的训练任务;电价上涨的时候,它会把算力负载转移到电力充足的地方去。该柔性调度可以使得数据中心随时降低三分之一左右的峰值负荷,对于单个机房而言是微小的变化,但是成千上万个机房一起进行调度,则相当于一个虚拟电厂。
会暂停
方法就是安装一个调度软件。电网紧张的时候,它会暂停非实时的训练任务;电价上涨的时候,它会把算力负载转移到电力充足的地方去。
会削峰
该柔性调度可以使得数据中心随时降低三分之一左右的峰值负荷,对于单个机房而言是微小的变化,但是成千上万个机房一起进行调度,则相当于一个虚拟电厂。
说白了,它不再需要电网铺设更多的铜线来供自己使用了,而是改变了自己用电的方式以适应电网。
这一步比省下多少钱更重要。
05
REVERSAL
电网与服务者的百年角色反转
过去的几十年里,电网一直是以服务者的身份存在的。哪里有工厂、哪里有居民区,电网就得到位,负荷走到哪里,配套就跟着到哪里。现在反过来了,数据中心主动安装了刹车和油门,变成了可以被调度的对象,这等于承认人工智能的发展速度已经超过了物理世界所能承受的速度。以前是先有电再有用电的地方;现在则是先考虑如何配合电网,才敢谈上线。
「以前是先有电再有用电的地方;现在则是先考虑如何配合电网,才敢谈上线。」
中国已经下了规划:八大国家算力枢纽、三个算电协同发展区建成后,占全国智算规模的85%以上。把算力放到西部去,利用当地的风光资源就地发电,比在负荷中心强行建设电厂要聪明得多。
EPILOGUE
问题从来不是模型
所以,真正的问题是电量和算力能不能匹配上。
过去两年里,人工智能的故事都是关于模型有多聪明、参数有多大、可以替人做多少事情。但是这些故事有一个前提条件,就是要有电。
如果说过去两年行业瓶颈在于芯片的话,那么未来五年被卡住脖子的就可能是电力了。
热门跟贴