随手先关注,不错过每日AI热讯速递

9 月 2 日,Google DeepMind 发布Gemini 3.8 Flash3.8 Flash Cyber,这是它在六周内第三次更新 Flash 系列[1]。

官方把3.8 Flash定位为“迄今最智能的 workhorse 模型”,主打长周期编程与自主 Agent(能自主规划并调用工具完成多步任务的 AI 系统)[1]。

最亮眼的数字在软件工程上:3.8 Flash在 DeepSWE v1.1 长周期软件工程基准拿到73.7%,逼近Claude Opus 574.0%,高于上一代3.7 Flash65.3%[2]。

一个“预算级”模型做到这个程度,性价比相当能打。

打开网易新闻 查看精彩图片

图:Google 官方博客(Gemini 3.8 Flash 发布视觉)(来源:[1])

价格上 Google 选择了“加量不加价”:输入0.75 美元、输出3.75 美元每百万 token,与3.7 Flash完全持平[1]。

但这里藏着一个容易被忽略的细节——官方明说新模型会“更努力地工作”,在复杂任务上多跑几步推理、多调几次工具,用更多 token 换更高分数[1]。

第三方评测机构 Artificial Analysis 算了一笔账:3.8 Flash每任务输出 token 增加约30%,Agent 评估轮次也更多,导致实际成本比 3.7 Flash 高出约 40%,尽管单价没变[2]。

打开网易新闻 查看精彩图片

图:Gemini 3.8 Flash 基准对比表(来源:[2])

真正特别的是3.8 Flash Cyber这个安全变体。

它在网络安全漏洞挖掘基准 CyberGym(评估 AI 自动发现软件漏洞能力的行业标准)上拿到86.2%,超过上一代3.5 Flash Cyber77.5%

在覆盖20 种编程语言的内部漏洞发现基准上,成功率超过 70%[2]。

这个变体不对公众开放,只通过新的 Fairwind Program 提供给政府和可信伙伴[1]。

同一个底座、两套护栏——通用版走正常安全限制,Cyber 版放宽护栏只给可信防御者,这种“分叉治理”是本次发布最耐人寻味的设计。

当然短板也摆在台面上。3.8 FlashTerminal-bench 4.0仍明显落后于 Opus 5,终端操作这类任务差距不小[2]。Google 对此并不掩饰,反而建议追求效率的用户继续用 3.7 Flash[1]。

一句话总结:Gemini 3.8 用“更努力”换来了逼近旗舰的编码成绩,但省钱这件事,得看你的任务到底让模型多想了几步。

你觉得“单价不变但总价变贵”的定价方式能接受吗?欢迎在评论区说说你的看法。

参考来源:

[1] Google DeepMind 官方博客:Introducing Gemini 3.8 Flash and 3.8 Flash Cyberhttps://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

[2] The Decoder:Gemini 3.8 Flash is Google's third budget model in six weeks while frontier models remain MIAhttps://the-decoder.com/gemini-3-8-flash-is-googles-third-budget-model-in-six-weeks-while-frontier-models-remain-mia

欢迎分享、点赞、推荐

一起拥抱AI