9月,AI圈又"卷"出一个新王。
但这次,谷歌连发布会都省了——一个挂着"gemini-3.8-flash"化名的模型,悄悄爬上了 AI Arena 的榜首。没有公告,没有 PPT,连名字都像随手敲的。
编码 88.7%、智能体 95.3%、上下文 1000万 token。这不是常规升级,这是降维打击。
它到底什么来头?答案很刺激:这就是谷歌憋了很久的大招——Gemini 4 Pro。而它一出场,就直接把友商 Astra 和 Fable 5.1 按在地上摩擦。
① 偷跑登顶,数据碾压
先说怎么"偷跑"的。2026年9月19日前后,开发者实测发现,AI Arena(LMArena)上多了一个陌生 ID:"gemini-3.8-flash"。名字像个廉价 flash 版,实测却凶得离谱——它就是 Gemini 4 Pro 的旗舰本体。谷歌没发任何官方公告,就这么"软上线"了。
数据很快说话:
· 编码基准 DeepSWE v1.1:Gemini 4 Pro 拿下 88.7%,友商 Astra 是 86.9%——反超约 1.8 个百分点;
· 智能体 / 终端基准 Terminal-bench 2.1:干到 95.3%;
· GUI 智能体 OSWorld-2.0:86.8%;
· 真实经济任务 GDPval-AA v2:拿到 2064 Elo 的高分。
综合对手 Fable 5.1 在多个榜单被全面压制。一句话:这不是"差不多",是"我比你强一截"。
② 价格屠夫,商业降维
更吓人的是定价。Gemini 4 Pro 输入 $2.25 / 百万 token,输出 $11.25 / 百万 token——这个价格低于同类旗舰,被外界直接称为"价格屠夫"。
什么概念?同样的活儿,谷歌旗舰更猛,还更便宜。对手的护城河,一夜之间浅了一截。
还有一张底牌:上下文窗口 1000万 token(10M)。这意味着它能一口气吞下超长文档、做长程记忆,处理那些别的模型"读不完、记不住"的任务。长文本赛道,谷歌直接拉满。
有意思的是,谷歌干脆取消了 Gemini 3.5 Pro,直接跳代。这股狠劲,不像挤牙膏,像掀桌子。
③ RSI闭环,潘多拉魔盒
真正让行业后背发凉的,是底层范式。
9月14日,谷歌发布 Dream-RSI 论文,主题正是"递归自我改进"(Recursive Self-Improvement)。紧接着,Google DeepMind 首席科学官 Jasjeet Sekhon 公开谈到 RSI。而传闻更进一步:Gemini 4 Pro 内部已经跑通 RSI 闭环——模型能自我迭代、自我改进,不再只靠人类喂数据。
如果这是真的,意义远超一次跑分登顶。过去我们迭代 AI,是人推着模型走;RSI 一旦跑通,模型自己给自己踩油门。
当然,这也是潘多拉魔盒。一个能自我改进的模型,边界谁来守?谷歌母公司 Alphabet 市值约 4.23 万亿美元,足以支撑这场豪赌,但全行业都得接住它的回响。
认知重构:这不是"又一个更强模型"
把视线拉远一点。Gemini 4 Pro 不是"又强了一点"的故事,它可能是 AI 进化范式的一次换挡——更猛的性能、更狠的定价、更底层的自我迭代,三股力同时拧在一起。
"当模型开始自己迭代自己,人类第一次成了进化的旁观者。"
这不是终点,是油门被焊死的那一刻。转发这句话,记住今天。
热门跟贴