打开网易新闻 查看精彩图片

当Meta首席AI官轻描淡写问出“Gemini,谁啊?”,硅谷的AI江湖正在经历一场无声的权力洗牌。

2026年7月,硅谷的AI战火被一句挑衅彻底点燃。Meta首席AI官Alexandr Wang在社交媒体上转发了一份AI模型性能排行榜,配文仅有短短两个单词:“gemini who?”——这记精准的“冷枪”直指谷歌引以为傲的Gemini系列模型。导火索是一份榜单:Meta最新发布的Muse Spark 1.1在关键能力测试中,得分超越了谷歌刚推出的Gemini 3.6 Flash。

打开网易新闻 查看精彩图片

这并非一次简单的口舌之争,而是整个AI行业格局剧变的缩影。曾凭借Gemini 3系列扳回一局的谷歌,如今因旗舰模型Gemini 3.5 Pro的一再延期,正面临来自Meta、OpenAI乃至Anthropic的集体围剿。曾经稳固的技术“王座”,正在变得前所未有的摇晃。

嘲讽背后:一场精心策划的“碰瓷营销”?

事情源于X平台用户Tae Kim分享的一份Artificial Analysis Intelligence Index数据榜单。该榜单对主流大模型进行了综合比较,结果显示,Anthropic的Claude Fable 5、OpenAI的GPT-5.6等顶级模型仍居前列,但Meta的Muse Spark 1.1在推理、代码生成及Agent任务执行等关键维度上,以明显优势超过了谷歌最新的Gemini 3.6 Flash(得分50)。

Alexandr Wang的转发,让这场技术比拼瞬间升级为公开羞辱。值得注意的是,Wang并非普通高管——2025年,Meta CEO扎克伯格通过一笔约150亿美元的交易将这位Scale AI创始人招致麾下,任命其为Meta首席AI官,主攻超级智能方向。他的言论,某种程度上代表着Meta新AI战略的正式宣战。

这场“碰瓷”看似即兴,实则时机精准。 就在同一天,谷歌刚刚发布了三款新模型,包括性能提升的Gemini 3.6 Flash、网络安全优化的Cyber版,以及面向智能体场景的Lite版。然而,旗舰产品Gemini 3.5 Pro的持续跳票,让谷歌的这场发布显得底气不足。Wang的嘲讽,恰好打在了谷歌最敏感的“延期”痛点上。

Benchmark“作弊”疑云与行业评判标准之争

不过,Muse Spark 1.1的领先并非没有争议。早在该模型发布之初,著名AI研究员François Chollet就曾公开批评,认为Muse Spark过度针对公开基准测试(Benchmark)进行优化,在实际泛化能力上存在短板。

面对这一质疑,Alexandr Wang的回应颇为坦诚:Meta很清楚Muse Spark在某些测试(如ARC AGI 2)中表现不理想。但他同时强调,Meta的策略是不求全指标领先,而是在Agent、代码和真实任务执行能力上寻求突破。 这一表态背后,折射出当前AI行业评判标准的深层转向——从单纯的“聊天能力”比拼,进阶到“AI能否帮用户完成复杂任务”的实用主义竞赛。

所谓Agent能力,即模型具备一定自主性:用户提出目标后,AI能主动规划步骤、调用工具、操作软件,并完成多步骤任务。Meta宣称,Muse Spark 1.1在多步骤推理、工具调用、电脑操作和编程任务上均有显著强化。这代表着AI竞争进入了新阶段:参数规模的数字游戏正在让位于真实场景的落地能力。

谷歌方面,Gemini 3.6 Flash也展示了类似方向的进步:在DeepSWE代码测试中得分从37%提升至49%,OSWorld-Verified计算机操作测试成绩从78.4%升至83%。双方其实在朝同一方向发力,但Meta显然更擅长把技术进展包装成对竞争对手的舆论攻势。

AI王座的“诅咒”:没有永远的领先者,只有不断重写的牌局

谷歌当前最大的被动,来自旗舰产品线的空窗期。Gemini 3.5 Pro的持续延期,与OpenAI、Anthropic近几周接连推出新一代旗舰模型形成了鲜明对比。Raymond James分析师Josh Beck指出,这一延迟已改变了市场对谷歌的看法——从“领先者”变成了“追赶者”。

打开网易新闻 查看精彩图片

更大的隐患来自内部预期管理。谷歌产品负责人Logan Kilpatrick在X上宣布下一代旗舰模型Gemini 4已开始预训练,并称其为“下一个重要里程碑”。这本是常规技术预热,却遭到OpenAI技术团队成员Thibault Sottiaux的暗讽:“希望它有一天能训练完吧!”——谷歌的“拖延症”显然已成为竞争对手攻击的靶子。

但过早判定谷歌出局或许并不明智。Moor Insights & Strategy分析师Anshel Sag认为,谷歌规模庞大,发展节奏与对手不同,既然官方提前预热Gemini 4,某种程度上说明“他们手里已经有了更好的东西”。他同时提醒,AI行业迭代速度极快,并非每次模型升级都意味着质的突破。

这场混战揭示了一个残酷事实:AI赛道的“王座”从未真正稳固。 几个月前,谷歌刚凭借Gemini 3重拾竞争优势;如今,它却成了被嘲讽的对象。前有OpenAI和Anthropic把持高端市场,后有Meta以“Agent优先”策略猛追,谷歌正面临四面夹击。

然而,在科技史上,一次Benchmark排名的更迭很少能决定最终胜负。真正的决胜点,在于谁能率先将AI能力转化为可持续的商业模式和生态壁垒。谷歌虽暂时被动,但其深厚的云基础设施、庞大的用户数据和多年技术积累,仍是其他对手短期内难以逾越的护城河。

对于旁观者而言,这场AI“权力的游戏”远未到终局。今天嘲笑谷歌的人,明天或许会被新的黑马所挑战——唯一可以确定的是,硅谷的AI牌桌上,没人能永远坐稳“庄家”的位置。

https://www.businessinsider.com/rivals-mock-google-gemini-3-5-pro-delay-2026-7