推理速度差距从哪来

Cerebras联合创始人兼CEO Andrew Feldman解释了晶圆级架构在大语言模型推理时比GPU快2500倍的原因。推理过程分为预填充和解码两个阶段,其中解码阶段的瓶颈尤为突出。

打开网易新闻 查看精彩图片

解码阶段的权重搬运

每生成一个token,都需要把模型权重从内存搬到计算单元。GPU的做法是从HBM读取权重,而Cerebras把权重直接存放在晶圆级处理器上的SRAM中。SRAM的读取速度远快于HBM,这一步提速约2500倍。

Feldman的说明点出了架构差异的核心:不是计算单元本身更快,而是权重搬运的路径更短、存储介质更快。对于逐token生成的解码阶段,这种差异会被反复放大。