每分钟处理190亿个token,每个月跑掉3.2千万亿个token,Gemini的后台账单正在把谷歌推向一个明确的决定:自研一颗只为自家模型服务的芯片。据The Information报道,这颗代号“Frozen v2”的定制芯片,悄悄把一部分Gemini的模型架构直接烧录进了硅片,效率有望做到现有TPU的6到10倍。

消息冒出来的时间点,恰好卡在Gemini 3.5 Pro延期之后。目前各大模型的榜单上,Gemini还没有一款能挤进前十,而亚马逊是另一家同样拥有全栈能力、消费与企业业务双线铺开的玩家。在AI大战里,谷歌手里攥着搜索、邮箱、云、YouTube的庞大生态,却始终缺一把能把推理成本打下来的便宜刀。

打开网易新闻 查看精彩图片

Frozen v2这把刀,砍的方向很刁。它不像常规TPU那样要适配五花八门的模型和工作负载,而是干脆放弃兼容性,死磕Gemini推理这一件事。芯片设计上,它不会把模型权重永久锁死在硬件里——那是一个更死板的早期版本“Frozen”的思路。新方案允许权重随时更新,所有跑不掉的通用运算和数据搬移,统统交给硬件加速。这一下,就能用同一片晶圆吃进更多token。

6到10倍的效率,换算到功耗上,意思很直白。同一批token的推理任务,理论上可以把耗电量砍掉83%到90%。不过,实际省下来的电费会打折扣,因为内存、网络、散热、土建、传统处理器这些边边角角依然得花钱。但即使这样,账已经很好算了。

经验更流畅、能跑更长的上下文、回应更快、挂载更重的智能代理,这些对用户端的升级都会因为推理成本的大幅压降而变得经济上可行。谷歌还能让更多免费用户涌进来,云服务定价可以杀得更狠,同时趟出来的交互数据又会回灌进模型,把Gemini的缺口一点一点堵上。2026年6月,谷歌曾披露过一组数字:旗下各模型接口每分钟处理大约190亿个token,整个产品矩阵月吞3.2千万亿个token。在这种量级上,单次推理省下的每一厘钱,翻起来都能砸出坑。

Frozen v2还能帮谷歌云解决一个越来越烫手的麻烦——缺卡。之前就有消息说,谷歌云因为容量吃紧,已经影响到客户拿不到足够算力。自研芯片路径一旦走通,对外供应和对内训练就有了更宽的缓冲区,不再完全依赖采购博通合作的TPU,甚至可能改写云上AI推理的定价规则。