如果你最近在关注海外大模型的动态,这两天大概率被谷歌 DeepMind 的骚操作给整懵了。
Gemini 3.7 Flash 才发布刚满三周,很多人甚至都还没来得及把 API 接进生产环境跑一轮全量测试,谷歌竟然连夜又掏出了 Gemini 3.8 Flash。
这迭代速度,简直就像生产线传送带焊死了一样。官方给出的数据依然是“加量不加价”,主打 Coding、Agent 复杂任务和专业多步推理。
但别急着欢呼。这两天各路一线开发者和知乎上的实测一出来,画风直接两极反转——有人惊叹谷歌成了“后训练仙人”,也有人直言“最无耻的一集,测试集全给喂进去了”。
今天咱们就扒开官方宣传的华丽外衣,聊聊这个 3.8 Flash 到底藏了哪些猫腻。
一、 账面战力:跑分确实“拳打脚踢”
先看官方端出来的这盘菜,表面上确实香:
- 价格看起来没动:每百万输入 Token 还是 0.75 美元,每百万输出 Token 3.75 美元。
- 跑分直逼顶流旗舰:在代码智能基准 DeepSWE V1.1 上,3.8 Flash 拿下了 73.7% 的高分。官方直接宣称,它的编码和 Agent 表现已经基本追平了 Claude Opus 5 以及 GPT-5.6 Sol,但调用成本只是后者的一个零头。
- 专业推理大幅超越 3.7:在涉及 STEM、金融、法律的长链条推理测试中全面反超前代,HLE-Verified 拿到了 54.9%,在综合评测指数上也咬住了 GLM-5.3、Kimi K3 以及 Qwen-3.8 Max。
- 甚至还带了个“特化版”:这次谷歌还同步推出了主打网络安全的 Gemini 3.8 Flash Cyber,专抓代码漏洞和自动化修复,在 CWE-Bench 上的单次修复成功率跑到了 47.2%。
光看这套 PPT 和评测数据,感觉谷歌这次简直是把旗舰大模型的脸按在地上摩擦。
但且慢,现实往往比宣传骨感得多。
二、 钱包先被背刺:单任务成本偷涨 40%
很多做独立开发或者企业应用的朋友,第一反应往往是:“反正 Token 单价没涨,升就完了呗?”
这里面其实藏着一个巨大的成本陷阱。
有答主算了一笔极其真实的账:
虽然每百万 Token 的标价没变,但 单任务综合成本却从 3.7 Flash 的 0.40 美元,一路飙到了 0.58 美元,整整涨了 40%!
为什么?因为 3.8 Flash 强化了 Agent 多步推理逻辑。在实际跑任务时,输出的思考 Token 平均增加了 30% 以上,交互轮数也变多了。
就像去餐厅吃饭,单价确实没涨,但店员每次都多给你上一份主食,结账时你一看账单,该多花的一分没少。
三、 实测现形记:跑分野榜与底模露馅
如果说成本微涨换来实力质飞跃,大家也就认了。但知乎和各路技术社区的一线实测,很快就泼了一盆冷水:
1. 疑似“测试集污染”,新榜立马露馅
在知乎讨论区,有实测答主直接吐槽:DeepSWE 刷到快 74 分,很有可能在后训练阶段把测试集全塞进去了。“在 DeepSWE 里我拳打 Fable、脚踢 Sol,结果 8 月底刚推出的 Terminal Bench 4.0 一测,立马打回原形,表现平平”。
很多开发者实战编码跑下来,处理稍微复杂一点的工程项目,连常规模型都打得费劲,代码幻觉依旧频发。
2. 底模知识库严重脱节
更离谱的是底层知识库。有细心的开发者扒出来,3.8 Flash 的底层预训练知识库依然停留在 2025 年 1 月。
所谓的新模型,很大程度上只是靠系统提示词硬塞了“我是 3.8 Flash”的设定,连谷歌自家最新的官方文档和技术博客都没给微调进去。
四、 大实话总结:后训练红利还能吃多久?
从 3.5、3.7 到如今的 3.8,大家能明显感觉到大厂的焦虑和打法:基模预训练进入瓶颈期,全靠后训练和 RL(强化学习)给模型强行打鸡血。
针对特定榜单猛刷后训练,确实能在发布会上搞出一份漂亮的成绩单。但当这股后训练红利被过度透支,牺牲的往往是泛化能力和真实业务场景下的稳定性。
给正在选型的开发者两点实在建议:
- 别盲信任何官方单项榜单:新模型出来,务必拿自己真实业务里的测试用例去跑,看看幻觉率和工程完备度;
- 盯紧实际 Token 消耗:算账不能只看单价,Agent 任务多轮交互和推理长文本产生的总消耗,才是月底账单的大头。
谷歌这次的“小步快跑”,你觉得是诚意满满的性价比神作,还是为了市值 KPI 强行刷榜的“早产儿”?欢迎在评论区聊聊你的实测感受。
热门跟贴