谷歌昨晚又发新模型了。这已经是六周内的第三个版本,频率快得让人有点跟不上。这次的主角是Gemini 3.8 Flash,定位是推理与编程主力模型,上下文窗口100万个token,主打一个"便宜又能打"。
先说最扎眼的数字:在14项基准测试里,Gemini 3.8 Flash拿了8项第一,直接超过了Claude Opus 5和GPT-5.6 Sol。但它的定价,只有Claude Opus 5的三分之一左右。这个性价比,确实有点不讲武德。
价格屠夫,还是实力选手?
先看价格。Gemini 3.8 Flash目前优惠定价是每百万输入token 0.75美元、每百万输出token 3.75美元。标准定价是输入1.5美元、输出7.5美元。
对比一下同行:Claude Opus 5定价输入5美元、输出25美元,是Gemini标准定价的3倍多。GPT-5.6 Sol定价输入5美元、输出30美元,是Gemini的3到4倍。Terra定价输入2.5美元、输出15美元,约为Gemini的2倍。只有Luna定价输入1美元、输出6美元,比Gemini更便宜。
在Artificial Analysis智能指数上,Gemini 3.8 Flash拿了59分,和GPT-5.6 Sol、Grok 4.6的非最高推理配置持平。但它的推理成本,每个智能指数任务只要0.58美元(high模式),是同等级智能水平下最便宜的。中等推理模式降到0.41美元,低推理模式只要0.24美元。
说白了,就是花更少的钱,拿到差不多的智能水平。这对开发者来说,吸引力是实打实的。
8项第一,赢在哪些领域?
Gemini 3.8 Flash在14项测试中拿了8项第一,覆盖的领域挺广:
- 金融分析测试Vals Finance Agent v2
- 法律工作流测试Harvey Legal
- 终端代码测试Terminal-bench 2.1
- 复杂图表推理CharXiv
- 长视频理解LVBench
- 跨学科专家难题HLE-Verified
- 生物学真实科研任务LABBench2
这些测试覆盖了金融、法律、代码、图表推理、视频理解、科研任务等多个专业方向。谷歌DeepMind研究员姚顺宇的评价是:"对模型来说是一小步,对RSI(递归自我改进)来说却是一大步。"
这次发布包含两款模型:Gemini 3.8 Flash是主力模型,上下文窗口100万个token;Gemini 3.8 Flash Cyber是网络安全模型,在漏洞检测和自动修补方面达到前沿水平,通过全新的Fairwind计划向受信任的防御者开放。两个模型共享同一套基础智能,由长时运行的Agentic loop加速——这个loop用于递归评估和优化底层模型,让共享核心的编程、推理能力获得显著提升。
开发者实测:速度碾压,细节还差口气
外网已经有开发者上手试了。有人拿Gemini 3.8 Flash和Claude Opus 5做了个对比:同一个海浪模拟器任务,Opus 5耗时24分钟,3.8 Flash只用了37秒。不过Opus 5的成果细节处理更完善。
这位开发者倒是很乐观,说:"如果给Gemini和Opus 5相同的时间,Gemini在质量上也会把Opus彻底碾压。"
中国AI博主Chasen实测了"鹈鹕踩单车"的生成任务,感叹说:"这输出速度简直了,其实10s就把整体代码写完了,后面的是验证和再输出一次。"不过他也指出,鹈鹕的脚并没有踩在单车踏板上,自行车框架与车轮也错位了——速度是快了,细节还有瑕疵。
外网AI模型测评博主Lumina对比了Gemini 3.8 Flash、Gemini 3.7 Flash、GPT-5.6 Sol和Grok 4.6,全部开到最高配置,用同一套提示词生成罗马斗兽场。Lumina评价说:"Gemini 3.8 Flash比Gemini 3.7 Flash明显清爽利落得多,说实话也是这里面生成质量最好的之一。谷歌这次升级确实不错。"
实测案例:从DOS版谷歌地图到3D汽车模型
谷歌团队在博客里放出了几个实测案例,看起来确实有点东西:
Gemini 3.8 Flash仅凭一个简单的提示词,配合Google Antigravity中的循环指令,就构建出了一款融合谜题、环境叙事的3D游戏,利用Nano Banana生成的纹理打造沉浸式3D关卡,玩家扮演巫师在城堡中探索。
它还能仅凭单个提示词构建出一个功能完整的DOS版谷歌地图,完全可交互,支持地点查询、路线规划和街景浏览。用户还可以使用美国地质调查局的真实数据集,构建地形图,并探索实时横截面、2D投影以及科学解释。
Hardware Anatomy是一个由Gemini 3.8 Flash构建的交互式3D可视化工具,能生成符合物理尺寸比例的硬件设备拆解图,基于Three.js实现逼真渲染,自动将设备分解为多个层级,用户可通过拆解滑块展开查看。
还有开发者用Gemini 3.8 Flash生成了纯Three.js的DeBerti Design 2019款福特F-250"Transformer"工作卡车,3D汽车模型各组件齐全,还可以交互。
Meta隔空喊话:gemini是谁?
谷歌发布后,Meta也紧跟着在今天凌晨发布了Muse Spark 1.3。在Artificial Analysis智能指数排行上,Muse Spark 1.3超越了Gemini 3.8 Flash(high),仅次于Claude Fable 5.1和Claude Opus 5。
Meta首席AI官、超级智能实验室创始人Alexandr Wang(汪涛)转发了推文,还明呛谷歌:"gemini是谁?"
这火药味,属实有点浓。
怎么上手?
目前Gemini 3.8 Flash可以通过Google AI Studio、Android Studio或Gemini API直接调用,开发者也可以在Google Antigravity和Stitch里体验智能体工作流。企业用户在Gemini Enterprise中使用。订阅了AI Pro或Ultra的普通消费者可以在Gemini应用、谷歌搜索的AI Mode以及谷歌表格里体验。
在官宣推文的评论区,多数用户留言期待Pro版本模型发布。毕竟Flash版本已经这么能打,Pro版本会是什么水平,确实让人好奇。
六周连更三个版本,谷歌这波迭代速度确实快。价格打到对手三分之一,性能还能拿第一,这招"性价比碾压"对开发者市场的冲击力不小。至于Meta的隔空喊话,后续两家怎么过招,值得盯着看。
热门跟贴