谷歌的新旗舰Gemini 4 Argon终于来了。当地时间9月30日,谷歌公布这款模型,称其在部分编程和知识工作测试中超过GPT-6 Astra,但首批只向一小批网络安全合作伙伴开放。
谷歌表示,后续将先向付费API客户和Google AI Ultra订阅用户开放,但尚未公布具体日期。公司目前正参与美国政府的模型发布前自愿测试程序,并根据早期使用者的反馈完善防护措施。
据Axios报道,距离上一代旗舰Gemini 3推出已近一年。这段时间,谷歌不断更新更小、更便宜的Flash模型,新的旗舰却迟迟没有露面。皮查伊曾在5月表示,下一次重大模型更新会在6月推出。
编程有进步,也有没追上的项目
Argon主要面向软件开发、金融研究、法律文书和网络安全等需要连续完成多个步骤的工作。谷歌把模型的输出上限从6.4万token提高到100万token,为持续推理和生成较长内容留出更多空间。
谷歌公布的成绩显示,在考查长程软件工程任务的DeepSWE v1.1中,Argon得分77.9%,高于GPT-6 Astra的74.1%和Claude Opus 5.5的74.2%。覆盖金融、编程、法律和税务工作的Vals Index中,Argon为68.9%,Astra和Opus 5.5分别为63.1%和67.0%。
另外两项编程测试中,Argon仍落后于对手:FrontierSWE v2得分55.0%,低于Astra的65.5%;Terminal-Bench 4.0得分57.4%,低于Opus 5.5的66.4%。
谷歌已经让它改代码、节省内存
在对外开放前,谷歌内部已有数千名员工用上了Argon。公司介绍,工程团队正让它参与调试、算法设计,以及把C/C++代码迁移到Rust等工作。
在视频解码软件libgav1上,Argon智能体基于已有的Rust移植版,反复测试性能、检查编译结果,替换了约3.2万行代码。谷歌称,修改后的版本保持了相同的视频输出,运行速度达到原Rust移植版的2.7倍,更接近经过优化的C++版本。
另一组智能体分析了谷歌数据中心的性能数据,寻找并实施内存优化。谷歌称,部署这些改动可释放超过300 TiB内存。涉及重要系统的大规模代码重写,仍需经过自动化与人工审计、仿真测试和评审,才会进入生产环境。
先给安全团队用,再向付费用户开放
谷歌通过Fairwind计划向首批网络安全合作伙伴开放Argon,称它可以自主发现、验证和修复严重软件漏洞。
据谷歌介绍,安全公司Wiz已在公益项目Scan for Good中使用Argon,并发现了一处此前前沿模型未发现的严重漏洞,涉及多家医院使用的医疗软件及敏感个人信息。
谷歌表示,向可信网络防御者和内部团队提供的版本将不设网络安全任务防护限制,以便他们使用完整的防御能力。面向更广泛用户的版本,则还要加强恶意用途识别、提示注入防护和行为监控;任务执行偏离用户意图时,监控系统可以中止运行。
谷歌同时公布了Argon的API定价,首发期间打五折:每百万输入token收费2美元,输出10美元,常规价格分别为4美元和20美元。命中缓存的输入,按当期输入单价的5%计费。首发优惠的结束时间尚未公布。(易句)
(本文由AI撰文,网易编辑负责校对)