Google 这个 Flash 模型,多少有点把自家 Pro 架在火上烤了。

LM Arena 8 月 1 日的 Code Arena / WebDev 榜单里,gemini-3.6-flash 出现在第 16 名,分数 1532,票数 3261。更尴尬的是,老一代 gemini-3.1-pro-preview 在同一张榜上排到第 40 名附近。一个 Flash 档位模型,跑到旧 Pro 前面,这比单纯说“Google 又发了新模型”刺激多了。

打开网易新闻 查看精彩图片

图中红框圈住的是 Arena Code/WebDev 榜单第 16 名:gemini-3.6-flash。同一行能看到 1532 分、3261 票和 $1.50 / $7.50 的价格列,说明这不是社交平台传闻图,而是榜单页里的可见条目。

先把边界说清楚:这不是 Google 宣布 Gemini 3.5 Pro 正式发布,也不是说 Gemini 3.6 Flash 已经把 Claude、Kimi、OpenAI 的旗舰全打穿了。榜单第 1 还是 claude-opus-5-max,第 2 是 kimi-k3-max,前十里 Anthropic 和 Kimi 仍然很硬。

真正有意思的是另一层:Flash 这个原本偏速度、偏成本的档位,正在被推到代码和 Agent 场景里正面打榜。它前面是 Meta 的 muse-spark-1.1,后面紧挨着字节的 seed-2.1-pro-preview、OpenAI 的 gpt-5.6-luna-xhigh 和 gpt-5.6-terra-xhigh。这就不是“便宜模型凑合用”的故事了,而是 Google 在把中档模型塞进一线战场。

Google 官方文档也把这个方向写得很直白。gemini-3.6-flash 已经 GA,可用于生产环境;官方说它在复杂智能体任务、多模态任务里更强,完成多步工作流时需要的推理步骤、对话轮次和工具调用次数更少,还更适合代码生成和诊断脚本。

打开网易新闻 查看精彩图片

这张截图来自 Google AI for Developers。图中写明 Gemini 3.6 Flash 已 GA,可用于生产环境;模型 ID、输入输出价格、100 万 token 上下文和最多 64000 输出 token 都在同一页。

价格也值得拎出来看。Google 给 Gemini 3.6 Flash 标的是输入 $1.50 / 100万 token,输出 $7.50 / 100万 token,上下文 100 万,最大输出 64000 token。它不是全场最便宜,榜单里的 gpt-5.6-luna-xhigh 价格更低;但它在这张 Code/WebDev 榜上排在 Luna 前面,冲突点就在这里。

这会影响谁?不是每个普通聊天用户都会马上感知,但做代码 Agent、网页生成、自动化工作流的人会很敏感。以前大家盯着 Pro、Opus、GPT 旗舰,是因为长任务、工具调用和代码修改容易翻车。现在 Flash 档位开始在这些榜单里露头,开发者的选择题就变了:不是“能不能用”,而是“够不够强,便宜多少,跑一整晚会不会把账单烧穿”。

旧 Pro 最尴尬的地方也在这。用户等的是更强的 Pro,但榜单先把 Flash 推到了前面。Google 如果继续把能力下放到 Flash,Pro 的发布压力反而更大:它必须证明自己不只是名字更高级,而是真的值得更贵、更慢、更重的那一档。

所以这张榜单的看点,不是 Google 已经赢了。它更像一个提醒:AI 模型战不只是在旗舰之间互殴,下一轮可能是“中档模型把旧旗舰挤下桌”。如果 Flash 都开始能打,Pro 这个名字就不能只靠惯性吃饭了。