9月30日,Google发布了Gemini 4 Argon。发布帖里把它称为"我们下一个时代的前沿智能"。随它一起出现的,是一份价格、一张19行的基准测试表,以及100万token的输出上限。它没有一起出现的,是访问权限——目前Gemini 4 Argon只开放给Google Fairwind计划中的可信网络防御者,其他人什么时候能用,没有日期。

把那张表、唯一测过它的独立榜单和访问规则都读一遍之后,一个开发者今天到底能从Gemini 4身上拿走什么,答案比发布帖本身要复杂。

打开网易新闻 查看精彩图片

价格先摆上桌

发布价是每百万输入token 2美元,每百万输出token 10美元,缓存输入打95%的折扣。这个数字和OpenAI的GPT-6.1 Sol完全一致,而后者今天就能买到。

Google用的词是"introductory price",介绍性价格。介绍期什么时候结束,帖子里没有给日期。对开发者来说,这意味着现在这个价签的有效期是未知的。

输出长度是另一个卖点。Google说单次回复可以跑到"行业领先的100万token,此前是64K token"。6.4万token已经是一份很长的报告,100万token相当于一次回复里塞进好几本小说。落到开发场景里,就是整文件、整模块的重写可以在一次调用里完成,不用再把代码切成块拼起来。

Google自己的表,赢在哪输在哪

发布帖里有一张主对比表:19行,4列。Argon在其中14行被标为最佳,但其中一行是并列,所以诚实的计数是13胜、1平、5负。对手是GPT-6 Astra、Claude Fable 5.1和Claude Opus 5.5。

值得看的几行:

  • DeepSWE是头条,这是一个长周期编程基准,Argon领先约4分。
  • 法律那一行是最奇怪的胜利:Argon得分约20%,其他模型都停留在个位数,也就是说它在一场所有模型都不及格的考试里拿了最高分。
  • 发布帖正文从未提及的两行,反而最值得关注。在FrontierSWE v2和Terminal-bench 4.0上,Argon在四个模型里排最后——这是Google自己的表。Terminal-bench把智能体放进真实shell里,接近大多数人实际使用编程模型的方式,Opus 5.5在这一项领先9分。

Hacker News上一位用户lanthissa说得很直白:"deepswe和frontierswe之间的差距太大了。我觉得这应该是个很糟糕的信号,但希望它是好事。"

独立榜单上的位置和账单

能找到的、把Argon列进去的独立榜单是Artificial Analysis。它的图表把部分模型标为"未公开可用",说明它拿到了发布前的访问权限。

Argon并列第二,落后Opus 5.5五分,后者自发布以来一直占据榜首。两个需要注意的地方:Artificial Analysis测的是Argon的"high"档设置;它的指数(v4.3.2,十项评测)里包含Terminal-Bench 4.0,而这一项在Google自己的表里Argon已经是最后一名。

对Google公平的一点是账单。跑一遍这个指数,Argon每个任务花1.99美元,Opus 5.5是5.98美元,大约三分之一。但Argon话也多:跑完这个指数它用了约1.1亿输出token,中位数是8200万。按每百万输出10美元算,这份啰嗦本身就是你要付的钱的一部分。

安全才是发布会的真正主题

Google写道,Argon"能自主发现、验证并修补关键软件漏洞",并且"对于可信防御者和Google内部团队,我们将不带网络护栏地发布Argon"。有些视频把这件事描述成它能自己修复零日漏洞,但"zero-day"这个词并没有出现在Google的发布帖里。

帖子里有两项安全结果:

  • Wiz用Argon找到了"一个暴露敏感个人信息的严重漏洞,影响全球医院使用的医疗软件"。Wiz还报告了一项内部黑盒渗透测试基准:Argon 70.9%,Gemini 3.8 Flash Cyber为58.2%。
  • CWE-bench v1:Argon并列第一,最高分为