导 读
过去两年谈AI,大多在谈模型和芯片。默认的前提是:只要有钱、有芯片,算力就能一直扩下去。
最近,美国芯片公司迈威尔(Marvell)的高管在一场行业会议上说,从铜连接转向光连接,已经是“不得不走的路”;推理需求让一类关键内存的需求在9个月里涨了约10倍,一个机柜已经装不下。
卡住下一阶段算力的,是两样看得见摸得着的东西:铜,和内存。
01
第一堵墙:铜
机柜里,成百上千颗加速卡要连成一体,要靠铜缆高速互联。
机柜之间,也要连。
从另一个层面看,最耗铜的是供电:一个大型AI数据中心的耗电量,相当于一座小城市,从变电站到机柜,全是铜排、铜缆。
算力的扩张,本质上是用电的扩张;电的传输,离不开铜。
而铜矿从勘探到出铜,周期以年计,不像软件,改几行代码就能扩产。
02
第二堵墙:内存
AI芯片算力很强,但得有人把数据及时送到它嘴边。
内存跟不上,芯片就闲着,大部分时间在等数据。这叫“内存墙”。
大模型动辄几百亿、几千亿个参数,本身就要占内存;推理时要缓存的中间数据,更是在猛涨。
高带宽内存的产能,受设备和先进封装产线限制,扩产同样以年计。
03
为什么说“撞墙”而不是“卡脖子”
技术瓶颈,砸钱砸人,几年后可能就突破了。
产能瓶颈是周期性的:矿要挖,厂要建,设备要交货,工人要培训。
▍墙是能过去的 判断
这一轮遇到的,不是“能不能做”,而是“多久能做出来”。
墙能过,但得减速、绕路、等。
04
墙怎么翻过去
针对铜:以光替铜。距离越短越用铜,距离越长越用光;速率越高,铜能用的距离越短。迈威尔方面称,其方案可让光连接功耗降低约75%。
针对内存:提高单颗内存的带宽和容量,把内存放得离计算单元更近,少搬数据。
针对整体:算法优化,让同样的硬件跑出更多有效算力。
▍我们的机会在哪 观察
铜加工、变压器、电缆、配电设备,是算力基建的基建,国内产业链完整、产能充足。
光模块产业具备全球竞争力,“以光替铜”这条赛道上位置不差。
存储领域国内厂商在持续投入,越紧张,自给的价值越高。
最根本的一条:电力供给能力,是算力竞争的基础条件。
下一阶段的AI竞争,不只在模型层,也在材料层、制造层、能源层。那几层不性感,但最不容易被颠覆。
热门跟贴