2026 年 10 月 1 日,Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,主要面向软件开发、企业知识工作和网络安全防御等复杂任务。
目前 Argon 尚未全面开放,正通过 Fairwind Program 向一批受信任的网络安全防御人员逐步开放。
Google 表示,在收集早期测试反馈并继续完善安全防护后,将向开发者、企业和消费者扩大开放,目前尚未公布具体时间。
Argon 最突出的升级之一,是将单次输出上限从此前的 64K Token 提升至 100 万 Token。
Google 表示,更高的输出上限允许模型在单次任务轨迹中生成数十万 Token,用于处理需要深度推理和大量中间步骤的复杂长周期任务。
价格方面,Gemini 4 Argon 首发优惠价为每百万输入 Token 2 美元、每百万输出 Token 10 美元,缓存输入 Token 的价格较普通输入低 95%。
Google 表示,优惠期结束后,输入和输出价格将分别调整至每百万 Token 4 美元和 20 美元。
从 Google 公布的评测结果看,Argon 在知识工作领域的多项测试中高于表内的 GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5。
Vals Index 中,Argon 得分 68.9%,另外三款模型分别为 63.1%、65.8% 和 67.0%。
AutomationBench 中,Argon 得分 51.3%,另外三款分别为 41.4%、31.4% 和 42.5%。
在金融和法律智能体测试中,Argon 的 Vals Finance Agent v2 得分为 65.4%,GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5 分别为 53.5%、58.9% 和 58.6%。
Harvey’s Legal Agent Benchmark 中,Argon 得分 19.6%,另外三款模型分别为 5.4%、6.7% 和 3.8%。
编程方面,Argon 在 DeepSWE v1.1 中取得 77.9%,GPT-6 Astra 为 74.1%,Claude Fable 5.1 为 67.4%,Claude Opus 5.5 为 74.2%。
Vibe Code Bench 中,Argon 得分 91.9%,另外三款模型分别为 89.6%、90.3% 和 90.3%。
不过,Argon 并非所有编程测试都领先。
在 FrontierSWE v2 中,Argon 得分 55.0%,GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5 分别为 65.5%、56.3% 和 62.3%。
Terminal-bench 4.0 中,Argon 得分 57.4%,另外三款模型分别为 58.2%、57.9% 和 66.4%。
在 GraphWalks 的 256K 至 1M BFS 测试中,Argon 得分 84.2%,GPT-6 Astra、Claude Fable 5.1 和 Claude Opus 5.5 分别为 71.8%、65.0% 和 66.8%。
多模态理解测试 LVBench 中,Argon 得分 91.7%,另外三款模型分别为 87.5%、79.7% 和 83.7%。
网络安全是 Argon 首批开放的重点领域。
Google 表示,该模型能够自主寻找、验证并修复关键软件漏洞。
在真实世界漏洞发现测试中,Argon 扫描覆盖 20 种编程语言的源代码,得分为 85.8%,高于 Gemini 3.8 Flash Cyber 的 71%。
在 Wiz Penetration Test Benchmark 中,模型需要在没有源代码的情况下发现并利用 Web 漏洞,Argon 得分为 70.9%,Gemini 3.8 Flash Cyber 为 58.2%。
Google 表示,对于受信任的网络安全防御人员及内部安全团队,将移除 Argon 的网络安全防护限制,以提供完整的防御能力。
在 CWE-bench v1 中,Argon 与 GPT-6 Astra 均取得 68%,Claude Fable 5.1 和 Claude Opus 5.5 分别为 58.0% 和 67%。
Google 同时公布了针对间接提示注入攻击的 Gray Swan IPI 测试结果,该指标越低越好。在攻击者最多尝试 15 次的情况下,Gemini 4 Argon 的攻击成功率仅为0.7%,为图中所有参测模型最低;Claude Opus 5.5 和 Claude Fable 5.1 均为 1.0%,GPT-6 Astra 为 8.5%,GPT-6 Sol 为 10.1%,GLM-5.3 为 31.5%,Grok 4.6 和 Kimi K3 分别达到 51.8% 和 52.7%。
Google 表示,对于受信任的网络安全防御人员及内部安全团队,将移除 Argon 的网络安全防护限制,以提供完整的防御能力。
Argon 已经在 Google 内部投入使用。
Google 披露,目前已有数千名员工利用该模型处理专业编程、深度研究和写作等任务。Argon 智能体还通过分析数据中心性能寻找内存优化方案,相关优化部署后已经释放超过 300 TiB 内存,Google 预计最终可释放约 500 TiB 至 1 PiB。
在软件工程领域,Argon 被用于 Google 内部 C/C++ 代码向 Rust 的迁移,涉及的代码库规模从数万行一直延伸至超过 80 万行代码的 Fuchsia Zircon 内核。
Google 还披露,在 libgav1 项目中,Argon 智能体替换了 3.2 万行 SIMD 代码,生成的 Rust 视频解码器运行速度达到此前 Rust 版本的 2.7 倍,同时保持一致的视频输出。
在扩大开放范围前,Google 将继续加强针对模型滥用、间接提示注入、模型行为和运行环境等方面的安全措施。
Google 表示,其监控系统能够检查 Argon 的推理过程和行动,并在必要时停止执行。Google 同时正在参与美国政府针对前沿 AI 模型的自愿预发布访问机制。
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。
热门跟贴