你发现没,最近AI圈闷声干大事的炒作越来越多了。谷歌7月21日连个发布会都没开,就靠社交平台和产品页扔了三款全新Gemini轻量模型出来。既没有预热海报,也没有高管出来站台造势,活脱脱就是闷声搞事情的架势。不少人刚看到消息都懵了,说好的旗舰Gemini 3.5 Pro都跳票快一个月了,怎么先把三款轻量模型放出来了。

打开网易新闻 查看精彩图片

这次更新的核心主力就是Gemini 3.6 Flash,所有升级全堆在效率这一块了。官方给出的数据显示,它输出Token的消耗比上一代3.5 Flash降了大概17%,DeepSWE编码场景最高能压65%的冗余输出。API单价直接从每百万Token9美元砍到了7.5美元,实打实给开发者降本。

第三方测出来的数据更直观,生成速度从165 tokens/s升到了304 tokens/s,差不多直接翻了一倍。原来平均2.6分钟做完的任务,现在1.3分钟就能搞定,时效性提了一半还多。要是放在高并发的Agent工作流里,每一步都快一倍,整体效率差只会拉得更大。

代码基准测试里,DeepSWE的成绩从37%涨到了49%,机器学习的MLE Bench从49.7%升到了63.9%,OSWorld-Verified电脑操控准确率也达到83%。原来在Frontend Code Arena排第21位,现在直接冲到第12位,在设计参考、工具开发这类细分场景,已经挤进全球前十梯队了。

打开网易新闻 查看精彩图片

有意思的是,第三方机构Artificial Analysis的综合智能评分显示,它的底层理解能力和上一代3.5 Flash没差,根本没涨所谓的“智商”。所有优化全奔着一个目标去,用更少的算力成本,完成同等复杂度的任务。这种升级路线,其实很多人都没料到。

这种挤水分式的升级,刚好戳中了现在开发者最闹心的点。之前很多团队搭多步骤Agent工作流,大模型总输出一堆没用的冗余内容,不光拖慢任务速度,还平白多花好多Token钱。看着单次调用没多少钱,月底对账的时候总发现账单超了一大截。这次3.6 Flash相当于把无效输出的水分全挤干了,每一分算力都花在了实际产出上。

打开网易新闻 查看精彩图片

谷歌这次一起放出来的第二款是Gemini 3.5 Flash-Lite,它把极致低价和高吞吐做到了行业新低点。定价是每百万Token输入0.3美元、输出2.5美元,生成速度能到每秒350个输出Token,吞吐量比同级别产品高出一大截。长上下文能力比上一代3.1 Flash-Lite也提了12个百分点。

这款模型完全就是给海量标准化流水线任务量身定做的。批量文档摘要、简单信息检索、大规模智能搜索这类不需要复杂最后亮相的Gemini 3.5 Flash Cyber,定位非常清晰,完全面向垂直安全场景打造。它专门针对代码漏洞扫描做了微调,现在只对政府和谷歌认证的可信企业开放内测。在CyberGym基准测试里,它的成绩已经具备行业竞争力。这款相当于补全了谷歌在AI安全赛道的产品拼图,既满足了政企客户的专属安全需求,也避免相关能力流到不可控的公开场景。

逻辑推演的粗活累活,交给它跑完全能兼顾速度和成本。说它是高并发场景的“算力耗材”真没说错,性价比直接拉满。刚很多人把这次三款轻量模型的发布,说成是旗舰Gemini 3.5 Pro跳票的无奈补位,其实真不是这么回事。拉长时间线看,这更像是整个AI行业竞争重心转方向的标志性事件。前两年AI圈拼的就是参数规模和综合跑分,谁智能评分更高、上下文窗口更大,谁就能拿到最多的关注和资源。

好戳中了很多中小团队想要低成本跑批量现在大模型的基础能力都跨过了能用的门槛,企业级客户的核心需求早就悄悄变了。比起偶尔冲一次高难度任务的高分,他们更在意日常大规模调用的时候,综合成本够不够低,运行稳不稳定,吞吐效率够不够快。行业测算过,2026年全球AI推理算力的总消耗,已经是训练算力的6倍还多。

打开网易新闻 查看精彩图片

任务的核心需求

打开网易新闻 查看精彩图片

等百万级企业客户都把大模型接入日常生产流程,单次调用省几厘钱、速度快一倍,最后摊开的成本差距会被放大到难以想象的程度。谷歌这次把资源倾斜到轻量模型的效率优化上,本质就是提前押注下一个阶段的行业竞争核心,抢先占住有利位置。

当然谷歌也没停下旗舰产品的研发脚步,Alphabet CEO在Q2财报会上已经公开确认,谷歌已经启动史上最大规模的Gemini 4预训练项目。新模型支持4M+原生多模态上下文窗口,后续还会采用接近月度迭代的发布节奏。谷歌的路线很清晰,一边抓落地的成本效率,一边冲旗舰的能力上限,两手都没松。

打开网易新闻 查看精彩图片

从追跑分的军备竞赛,转向拼效率的落地深耕,AI行业的下半场才刚刚拉开序幕。现在很多人还在盯着旗舰模型的跑分卷,其实产业落地的真正需求早就转了方向。能把大模型的使用成本打下来、把吞吐效率提上去的玩家,最终才能在海量的产业落地场景里站稳脚跟。

参考资料:新华网 《全球AI大模型产业发展观察》