随手先关注,不错过每日AI热讯速递
①
9 月 2 日,Google DeepMind 发布Gemini 3.8 Flash3.8 Flash Cyber,这是它在六周内第三次更新 Flash 系列[1]。
官方把3.8 Flash定位为“迄今最智能的 workhorse 模型”,主打长周期编程与自主 Agent(能自主规划并调用工具完成多步任务的 AI 系统)[1]。
最亮眼的数字在软件工程上:3.8 Flash在 DeepSWE v1.1 长周期软件工程基准拿到73.7%,逼近Claude Opus 574.0%,高于上一代3.7 Flash65.3%[2]。
一个“预算级”模型做到这个程度,性价比相当能打。
图:Google 官方博客(Gemini 3.8 Flash 发布视觉)(来源:[1])
②
价格上 Google 选择了“加量不加价”:输入0.75 美元、输出3.75 美元每百万 token,与3.7 Flash完全持平[1]。
但这里藏着一个容易被忽略的细节——官方明说新模型会“更努力地工作”,在复杂任务上多跑几步推理、多调几次工具,用更多 token 换更高分数[1]。
第三方评测机构 Artificial Analysis 算了一笔账:3.8 Flash每任务输出 token 增加约30%,Agent 评估轮次也更多,导致实际成本比 3.7 Flash 高出约 40%,尽管单价没变[2]。
图:Gemini 3.8 Flash 基准对比表(来源:[2])
③
真正特别的是3.8 Flash Cyber这个安全变体。
它在网络安全漏洞挖掘基准 CyberGym(评估 AI 自动发现软件漏洞能力的行业标准)上拿到86.2%,超过上一代3.5 Flash Cyber77.5%
在覆盖20 种编程语言的内部漏洞发现基准上,成功率超过 70%[2]。
这个变体不对公众开放,只通过新的 Fairwind Program 提供给政府和可信伙伴[1]。
同一个底座、两套护栏——通用版走正常安全限制,Cyber 版放宽护栏只给可信防御者,这种“分叉治理”是本次发布最耐人寻味的设计。
④
当然短板也摆在台面上。3.8 FlashTerminal-bench 4.0仍明显落后于 Opus 5,终端操作这类任务差距不小[2]。Google 对此并不掩饰,反而建议追求效率的用户继续用 3.7 Flash[1]。
一句话总结:Gemini 3.8 用“更努力”换来了逼近旗舰的编码成绩,但省钱这件事,得看你的任务到底让模型多想了几步。
你觉得“单价不变但总价变贵”的定价方式能接受吗?欢迎在评论区说说你的看法。
参考来源:
[1] Google DeepMind 官方博客:Introducing Gemini 3.8 Flash and 3.8 Flash Cyberhttps://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
[2] The Decoder:Gemini 3.8 Flash is Google's third budget model in six weeks while frontier models remain MIAhttps://the-decoder.com/gemini-3-8-flash-is-googles-third-budget-model-in-six-weeks-while-frontier-models-remain-mia
欢迎分享、点赞、推荐
一起拥抱AI
热门跟贴