导 读

过去两年谈AI,大多在谈模型和芯片。默认的前提是:只要有钱、有芯片,算力就能一直扩下去。

最近,美国芯片公司迈威尔(Marvell)的高管在一场行业会议上说,从铜连接转向光连接,已经是“不得不走的路”;推理需求让一类关键内存的需求在9个月里涨了约10倍,一个机柜已经装不下。

卡住下一阶段算力的,是两样看得见摸得着的东西:铜,和内存。

打开网易新闻 查看精彩图片

01

第一堵墙:铜

机柜里,成百上千颗加速卡要连成一体,要靠铜缆高速互联。

机柜之间,也要连。

从另一个层面看,最耗铜的是供电:一个大型AI数据中心的耗电量,相当于一座小城市,从变电站到机柜,全是铜排、铜缆。

算力的扩张,本质上是用电的扩张;电的传输,离不开铜。

而铜矿从勘探到出铜,周期以年计,不像软件,改几行代码就能扩产。

02

第二堵墙:内存

AI芯片算力很强,但得有人把数据及时送到它嘴边。

内存跟不上,芯片就闲着,大部分时间在等数据。这叫“内存墙”。

大模型动辄几百亿、几千亿个参数,本身就要占内存;推理时要缓存的中间数据,更是在猛涨。

高带宽内存的产能,受设备和先进封装产线限制,扩产同样以年计。

打开网易新闻 查看精彩图片

03

为什么说“撞墙”而不是“卡脖子”

技术瓶颈,砸钱砸人,几年后可能就突破了。

产能瓶颈是周期性的:矿要挖,厂要建,设备要交货,工人要培训。

▍墙是能过去的  判断

这一轮遇到的,不是“能不能做”,而是“多久能做出来”。

墙能过,但得减速、绕路、等。

04

墙怎么翻过去

针对铜:以光替铜。距离越短越用铜,距离越长越用光;速率越高,铜能用的距离越短。迈威尔方面称,其方案可让光连接功耗降低约75%。

针对内存:提高单颗内存的带宽和容量,把内存放得离计算单元更近,少搬数据。

针对整体:算法优化,让同样的硬件跑出更多有效算力。

▍我们的机会在哪  观察

铜加工、变压器、电缆、配电设备,是算力基建的基建,国内产业链完整、产能充足。

光模块产业具备全球竞争力,“以光替铜”这条赛道上位置不差。

存储领域国内厂商在持续投入,越紧张,自给的价值越高。

最根本的一条:电力供给能力,是算力竞争的基础条件。

下一阶段的AI竞争,不只在模型层,也在材料层、制造层、能源层。那几层不性感,但最不容易被颠覆。