周三下午,The Information的一则报道在芯片圈和AI从业者的信息流里刷了屏。话题核心不是哪家又推出了新一代GPU,而是谷歌正在把大模型的底层运算逻辑直接写进芯片。

据知情人士透露,谷歌正在研发一款代号为“Frozen v2”的全新服务器芯片。这款芯片不同于市面上任何一种通用AI加速器,它的核心突破在于将Gemini大模型的底层运算架构直接固化进硬件层面。带来的效果是:单位功耗可处理的词元数量预计达到谷歌现有自研AI芯片的6至10倍,大幅降低AI推理过程中的能耗与延迟。

打开网易新闻 查看精彩图片

“Frozen”这个代号精准概括了它的设计哲学——将大模型的部分运算逻辑永久蚀刻在硅片硬件中。与英伟达GPU以及谷歌自家的TPU需要实时执行大量逻辑判断不同,Frozen v2专为Gemini系列模型量身打造,通过内置底层运算逻辑来显著减少运算步骤和数据搬运量。这不仅能实现更快的用户响应速度,还有望支撑谷歌推出全新的AI应用场景。

谷歌当前正面临严峻的AI算力短缺困境。内部资源紧张已经到了让谷歌云不得不回绝部分外部客户合作订单的地步。Frozen v2项目的启动正是为了从根本上破解这一瓶颈。知情人士表示,该芯片最早计划于2028年部署。

这并非谷歌首次尝试将AI模型“写入”硬件。初代方案由谷歌DeepMind首席科学家杰夫·迪恩牵头,计划将完整的模型权重直接蚀刻进芯片。但这个方案有一个致命缺陷:芯片只能适配单一版本的Gemini模型,硬件生命周期极短。项目因此被搁置多年。

Frozen v2在初代基础上做了关键调整。它不再固化完整模型权重,而是仅将底层架构逻辑固化进芯片,同时保留通过更新内置模型权重进行迭代的能力。不过,这意味着谷歌在押注一件重要的事:后续迭代的Gemini模型必须沿用与芯片设计时一致的基础架构,才能在该芯片上正常运行。目前,工程师团队仍在敲定核心功能模块及各组件的协同方案,同时在权衡固化模型信息的深度,以求在硬件灵活性与运行能效之间取得最佳平衡。

在谷歌的芯片版图中,Frozen v2将开辟一条全新的自研芯片产品线,与现有TPU形成互补关系,而非取而代之。谷歌今年已经推出第八代TPU,并直接面向云客户推广,正面挑战英伟达在AI芯片市场的垄断地位。谷歌已与Meta签署数十亿美元大单,向其出租TPU算力,同时积极将TPU推向英伟达的核心云厂商客户。

值得留意的是,谷歌自研AI芯片的战略已经初见成效。通过在设计TPU时围绕Gemini进行适配,谷歌有效降低了Gemini模型的运行成本——只是TPU内置的模型信息远少于Frozen系列芯片。

尽管技术前景令人瞩目,谷歌目前并无大规模量产Frozen v2的计划,其产能规模将远低于TPU。知情人士透露,有限的量产规模使谷歌可以延后引入外部设计和代工合作伙伴。谷歌更将这一代产品视为技术试验平台,待大模型底层架构趋于稳定后,为研发更高专用化芯片积累工程经验。

谷歌官方发言人对此回应称,公司各团队“持续研发、测试各类创新技术,力求为用户与企业客户实现极致性能与能效”,并强调“并非所有研发项目都会落地量产,但这种全方位技术探索,是我们全栈自研技术路线的核心一环”。