如果一块芯片天生就是为某个AI模型设计的,推理速度能比现有方案快6到10倍,你会不会觉得这是作弊?

据外媒The Information的消息,谷歌正在内部推进一个代号“Frozen v2”的服务器芯片项目,直接把Gemini模型的架构固化到硅片里。这不像是给GPU换个散热器——这是一场从编译器到底层晶体管的定制手术。谷歌想用这块芯片解决一个越来越尖锐的问题:每次回答用户问题时,AI推理烧掉的钱正在吃掉利润,而通用芯片的优化已经快卷到头了。

打开网易新闻 查看精彩图片

整件事最让人“倒吸一口凉气”的地方,不是效率数字本身,而是谷歌选择了一条和当前行业主流完全相反的路径。当所有人都在追求一个芯片跑所有模型、用软件层去适配花样百出的神经网络时,谷歌把一部分模型结构永久“写死”在硬件里。这很冒险,但也直白得有点可爱。

我们先按清单的骨架,把关键信息一层一层剥开。

1. “冻”住什么?为什么叫Frozen?

名字不是