打开网易新闻 查看精彩图片

四连超凡 Quadra kill,不是游戏,而是 Gemini 又双叒叕发新的 Flash 模型了。

出于刻板印象和谷歌低调的宣发,这次的 Gemini 3.8 Flash 世超本来没太上心。

但意外的是,网上风评很不错,尤其是编辑部的谷歌老粉,纷纷感慨:

难道说,Flash 才是对的?

打开网易新闻 查看精彩图片

看官方的跑分表,确实会被唬住,因为它拉来对标的,已经是 Claude 和 GPT 的旗舰模型了。

最有冲击力的提升都集中在「干活」两字上。

DeepSWE 这项,主打长线的编程开发能力,已经摸到了 Claude Opus 5 的屁股,只差 0.3%。

打开网易新闻 查看精彩图片

而像传统测 Agent 能力的 Terminal-bech,它在 2.1 版的测试里也是力压全场,豪取 89.45%;

不过在上个月更新的 4.0 版中,它又拉了个 19.1%,能力泛化差点意思。

打开网易新闻 查看精彩图片

除此之外,多模态成绩还算强势,科研,金融分析等专业领域,也小有进步。

而且翻开更具体的模型卡片能看到,3.8 Flash 的世界知识来到了 26 年的 3 月份,脑子里终于更新了点新东西。

打开网易新闻 查看精彩图片

但难崩的是谷歌很快打了个补丁,说只有部分领域是新的,很多老领域仍然是雷打不动的 25 年 1 月。。。

打开网易新闻 查看精彩图片

当然,重头戏还是性价比,3.8 Flash 这次性能跑分库库涨,但吐 token 的速度仍旧一泻千里。

看 Artificial Analysis 的榜单,大伙儿多半是两位数,就它干到了三百多

打开网易新闻 查看精彩图片

不过话说回来,比起之前,它执行起任务的速度反而要慢一些。

因为谷歌说 3.8 Flash 在工作中会更努力的调用工具,推理更多步骤,这样活儿会干得更漂亮,代价就是拉长交付时间。

打开网易新闻 查看精彩图片

价格这块儿也挺有活儿,虽然 Flash 的便宜大碗众所周知,但直接贴到跑分表里头两行,大写特写的,咱还是头一回见。

打开网易新闻 查看精彩图片

我们也简单实测了一下,省流就是除了快还是快,干活儿不懒,智商一般,但写东西意外的挺有人味儿。。。

比如同样生成一篇文章,讲述最近 DLSS 5 有争议的内容。

GPT 5.6 这儿东拼西凑两分半开始下笔,但你一下就能品到 AI 味儿,直冲天灵盖儿。

打开网易新闻 查看精彩图片

像「不是而是」这种已经是老版本了,现在是三五个字儿一句话,配合莫名其妙的设问,再点缀上无穷无尽的排比,读起来断断续续的,非常割裂。。。

Gemini 3.8 Flash 则是另一种画风,3000 字的稿子,17 秒足矣,多一秒都是对 Flash 的亵渎。

打开网易新闻 查看精彩图片

遣词造句的习惯也完全不同,风格更犀利,乐意用一些网络热梗去类比。

虽然偶尔显得用力过猛,但场景的渲染和情绪的递进都丝滑很多,读起来也流畅一些,起码没那么乏味。

打开网易新闻 查看精彩图片

不过你仔细看完,就会发现,这俩纯偏科生来的,Gemini 虽然说人话了,但它论证的准确度远不如 GPT 严谨。

接下来的 Coding 测试,表现就没有跑分看起来那么猛了。

先来个常规的 3D 场景建模,用网页还原二游那种渲染的质感,造个日式便利店。

打开网易新闻 查看精彩图片

就结果来看,确实达不到原作者 Demo 中 Claude Opus 5 的那种质感。

模型整体的规格和样式基本没错,但内部的细节就少了太多,而且光影效果也没按提示词来,整体的滤镜色调都差了个档次。

打开网易新闻 查看精彩图片

作为对比,下面又拿 GPT 5.6 Terra 和 Kimi K3 跑了一轮,虽然跑分表上他们旗鼓相当,但这俩的质感明显好很多。

超市的门能打开了,模型边缘也加了非常灵魂的黑色描边,多了很多二次元风格化的处理细节。

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

向左滑动,依次为GPT 5.6 Terra和Kimi K3

接下来加大难度,让它复刻经典的 Minecraft 游戏。

如果是网页版,配上一句话的提示词,那你将体验到窜稀一样的速度,它不到一分钟就能搓出来。

虽然跟预想的一样拉完了,但好在没啥 BUG,方块能挖也能放,主打一个简约。

而如果升级一下,用谷歌 AI Studio 的那套工具打辅助,那质感挠一下就上来了。

细节更接近 Minecraft 原版,方块的类型更多,玻璃草地的材质也很还原,尤其是游戏本体的功能性更丰富了,菜单有更多设置选项,游戏中也多了背包之类的复杂系统。

能看出来,有工具跟没工具的 Gemini 3.8 Flash 是两个玩意儿。

所以我干脆安装了 Antigravity,谷歌官方的本地 Agent 工具,看看更专业的 Harness 加持下,会不会有更好的效果。

不过还是得吐槽一下,比起 Codex,WorkBuddy 之类的应用,Antigravity 的使用体验就是一坨,没有中文适配,没有技能商店,第三方插件寥寥无几,一切都透露着原始美。。。

言归正传,这一版的 Minecraft 我让它结合一下漫威蜘蛛侠的玩法,能在城市间荡蛛丝。

这回没那么快了,花了大概 8 分钟,它才把成品掏出来。

打开网易新闻 查看精彩图片

地点设置在纽约的曼哈顿,Minecraft 的玩法都还在,方块都转化成了更适配主题的现代化材质。

可能是因为在执行前写了计划书的原因,完成度明显高了很多。

比如很多地标建筑,像帝国大厦,跨海悬索桥,拿方块还原的都不错,过河小桥,路灯这些小细节也不少,连史蒂夫本人都换成了 Spiderman 的皮肤。

不过这个荡蛛丝的玩法物理判定太复杂,它修了好几轮都还有 Bug,Spiderman 的速度诡异,一会儿飞起,一会儿卡住,在大楼之间来回抽搐抖动。

最后我又测了一下代码理解能力,让它去 GitHub 上把 DeepSeek Harness 拉下来,做个方便理解代码仓库的 wiki。

花了十分钟,它把项目从头到尾读了一遍,然后搓出了 wiki。

内容倒是没偷懒,架构设计,接入的协议,以及后续二次开发的标准都扒了出来。

打开网易新闻 查看精彩图片

但审美这块儿还是祖传的 AI 味儿,后续我让它自己装个 skill,然后重构一下前端。

结果它老毛病又犯了,2 分钟安装执行糊弄完毕,风格切换就是换个色儿,翻开思维链能看到,skill 装是装了,但只调用了一半儿就自作主张交差了。。。

打开网易新闻 查看精彩图片

这通测试下来,也能感觉到 Gemini 3.8 Flash 的尴尬之处,它执行速度奇高,但又有一堆莫名其妙的小毛病。

有前面 4 个月 4 个 Flash 模型的积累,没人比谷歌更懂 Flash 的性价比,所以执行效率没啥毛病。

但小毛病这块儿又确实影响体验,像 Minecraft 这个任务,网页版,AI Studio 和 Antigravity 的产物存在明显差距。

工具越少,约束越松散,它就越随心所欲。反之如果有靠谱的 Harness 去约束,有清晰的规划和边界,那它又会听话很多。

所以只能期待一手谷歌给 Harness 的升级,给模型补上能动的手脚,到时候就知道 Flash 这条路到底是夯还是拉了。。。

撰文 :风华

编辑:江江 & 面线

美编:素描

图片、资料来源

Google DeepMind,Artificial Analysis,DeepSWE,Google AI Studio,Gemini,Antigravity,部分图源网络

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片