今天凌晨4点,很久没有发布重磅产品的谷歌来了一个大的,Gemini 4 Argon终于来了。

打开网易新闻 查看精彩图片
根据知名大模型竞技场Arena.ai的最新数据显示,Gemini 4 Argon已经超过Claude Fable 5、Claude Opus 5.5等模型,登顶文本领域榜首。
打开网易新闻 查看精彩图片

100万输出token,全维度专业能力拉满相信很多人都听过100万输入窗口,这次谷歌直接把Gemini 4 Argon的输出窗口也拉升到了100万!而之前只有6.4万,足足提升了15倍。

打开网易新闻 查看精彩图片
这对于编程、金融、医疗、法律、量子计算等复杂任务来说帮助是极大的。谷歌官方放出了几个例子,我挑几个印象比较深的说说。一个是量子算法优化。量子计算听起来很遥远,但里面有个很实际的痛点,就是子程序的时空资源开销特别难调。Argon被拿去帮忙优化这些东西,结果几分钟就跑出了一个比公开基准方案性能高40%的结果。40%这个数字在量子领域算是相当夸张的进步,因为那边很多问题卡在瓶颈上好几年都动不了。
打开网易新闻 查看精彩图片
另一个是代码迁移。谷歌内部有大量C和C++的老代码,现在想往Rust语言搬,因为Rust在内存安全方面更让人放心。但几万行甚至几十万行的代码重写,人工做起来非常痛苦。Argon在这件事上表现得很能干,比如有个叫libgav1的开源视频解码库,它基于已有的Rust移植版本,自己做了多轮性能实验,分析编译器输出,重写了32000行SIMD代码。最后出来的解码器性能是原来Rust版本的2.7倍,视频输出还完全一致,已经接近深度优化过的C++版本了。
打开网易新闻 查看精彩图片
这个细节挺打动我的,因为代码迁移最怕的就是改出bug,而它不光改完了,还改得更快了。

在服务器运维优化方面,模型可以自主分析全网服务器的运行数据,智能识别内存资源浪费的问题,自动匹配对应的优化方案。

目前落地优化后,已经释放出超300TiB的闲置内存,后续全部优化完成,预计能节省最高1PiB的内存资源,极大降低了谷歌数据中心的运营成本。

打开网易新闻 查看精彩图片
再说说Argon在企业场景里的表现。谷歌搞了一个叫DeepSWE v1.1的评测,专门衡量真实长周期软件工程能力,Argon拿了77.9%的高分成绩。还有一个叫Vals指数的东西,这个指数挺有意思,按美国GDP各行业占比来加权,看模型在金融、代码、法律、税务这些领域到底能带来多少实际业务价值。Argon在这个指数上也是领跑的。
打开网易新闻 查看精彩图片
另外在金融研究、法律文书、端到端业务执行这些专项评测里,都排在头部位置。视觉理解方面也没落下。有个长视频理解评测叫LVBench,Argon拿了91.7%的当前最优成绩。这意味着你给它一段很长的视频,能分析里面的细节,结合多份文档给出行动方案。
打开网易新闻 查看精彩图片
这个能力放在实际工作里,比如做竞品分析或者整理会议记录,会省掉很多人工来回翻看的麻烦。网络安全能力网络安全这块值得单独拎出来讲。谷歌这次给Argon做了专项训练,让它能自己找漏洞、验证漏洞、然后修漏洞。而且面向受信任的安全防御人员,他们会移除网络安全相关的限制,让模型放开手脚去干活。有个叫Wiz的安全公司已经在用,通过一个叫善意扫描计划的项目,免费保护关键公共基础设施。早期实践里,Argon发现了一套全球医院都在用的医疗软件里的高危漏洞,这个漏洞会泄露敏感个人信息。而之前的前沿AI模型都没能识别出来。这个案例让我觉得,AI在防御端的作用可能比我们想象的来得更快。
打开网易新闻 查看精彩图片
在漏洞修复能力的CWE-bench v1评测里,Argon拿到68%的高分,和其他模型并列头部。相比上一代的Gemini 3.8 Flash Cyber,进步是跨越式的。Wiz内部的黑盒渗透测试也显示,在攻击面识别、漏洞挖掘、生成概念验证证据这些维度上,Argon都优于前代。当然,能力越强,安全管控就越不能马虎。谷歌这次在正式广泛发布之前,从四个方向加固了防护体系。一是防范滥用,防止有人拿去做网络攻击或者化生放核攻击,模型会拒绝有害请求,同时兼顾合法的两用科研场景。
打开网易新闻 查看精彩图片
二是抵御提示注入攻击,Argon是目前谷歌抗这类攻击最强的模型。三是监测模型行为偏离,监控思维链和执行动作,必要时终止任务。
打开网易新闻 查看精彩图片
四是加固运行环境,对沙箱做隔离和安全加固。他们还特别呼吁全行业保留模型推理过程的透明性,方便定位诊断异常行为。如何使用考虑到前沿AI能力的落地风险,谷歌采用了循序渐进的开放策略。目前模型优先对全球可信的网络安全防御人员开放,同时参与预发布合规审核,持续收集实战反馈,不断优化模型的安全边界和使用体验。定价方面也十分亲民,每百万输入token仅需2美元,每百万输出token为10美元。缓存内容的输入费用还能享受优惠,降低了企业和开发者使用专业AI的成本门槛。
打开网易新闻 查看精彩图片
后续模型会逐步面向付费API用户、谷歌AI高级订阅用户开放,之后慢慢普及到普通开发者和大众用户。整体读下来,我的感受是,Argon不只是在刷榜,它已经在真实工作流里产生了可量化的价值。从量子算法到代码迁移,从医疗漏洞发现到法律金融研究,这些场景都不是玩具级别的演示。但说实话,看完这些案例,我反而更在意另一件事。模型越来越强,咱们普通人手里的活会不会哪天就被接走了。光焦虑没什么用,关键是得摸清自己现在到底站在什么位置,哪些能力是AI暂时替代不了的,哪些地方其实已经被落下了。如果你也想大概测一下自己的AI能力跟实际业务需求之间差了多少,可以试试这个AI思维素养测评的小程序,点下面这个蓝色链接。

数智化人才能力测评

几分钟就能给自己的AI能力做一个全面检查,AI职业画像、AI思维素养、AI替代风险评测等等,整个测试不简单,即便是AI老鸟想得满分也不容易。

打开网易新闻 查看精彩图片

另外我建了一个AI产品交流群,大家对AI有什么想交流的可以进群,人数满了就加saiyi6888。