过去半年,AI圈一直有一个问题:
谷歌的Gemini,到底去哪了?
OpenAI持续推进GPT系列,Anthropic靠Claude系列不断吸引开发者关注。
反观谷歌,虽然一直顶着AI巨头的名头,但Gemini最近的存在感明显低了不少。
甚至有人开始怀疑:
谷歌是不是在这轮AI竞赛里慢了一步?
结果昨天,谷歌突然亮牌。
Gemini4Argon,正式发布。
这一次,谷歌没有把重点放在聊天、写作这些大家已经熟悉的能力上。
它盯上的,是AI下一阶段最重要的方向:
让AI真正参与复杂工作。
不过先说一个现实问题:
目前Gemini4Argon还没有全面开放。
普通用户暂时无法直接体验。
但从谷歌公布的信息来看,这款模型明显是在为AIAgent时代准备。
Gemini4Argon,最大的变化是什么?
如果把过去的AI比作一个很聪明的助手,那么Gemini4Argon想做的事情,是让这个助手拥有更强的持续工作能力。
因为真正复杂的任务,从来不是一句话能解决的。
比如:
分析大量资料;维护一个大型代码项目;完成金融研究;处理企业内部流程。
这些事情需要AI连续思考、反复验证、不断调整。
过去模型最大的问题,不一定是不会回答,而是任务一复杂,就容易丢失上下文。
Gemini4Argon这次最大的变化,就是把输出能力直接拉到了一个非常夸张的水平。
100万Token输出上限。
注意,这里说的是输出Token。
不是上下文窗口。
简单理解:
以前AI像一个能力很强,但容易忘事的员工。
刚开始工作效率很高。
任务一长,就需要重新解释背景。
而更大的输出空间,意味着它可以在一次任务里进行更长链路的推理和执行。
对于代码迁移、研究报告、企业自动化这些场景,会更有价值。
当然,Token数量增加,并不代表模型一定更聪明。
真正困难的是:
AI能不能一直保持目标,知道什么时候继续推进,什么时候检查错误。
这也是未来Agent模型竞争的关键。
跑分成绩,谷歌这次确实打得很猛
按照谷歌公布的数据,Gemini4Argon在多个测试中取得领先。
其中比较受关注的是:
DeepSWEv1.1软件工程测试:77.9%
主要测试AI处理真实软件开发任务的能力。
ValsIndex企业知识工作测试:68.9%
覆盖金融、法律、编码等多个专业场景。
LVBench长视频理解测试:91.7%
考察AI对长视频信息的理解能力。
Harvey法律智能体测试:19.6%
谷歌公布结果中处于领先位置。
这些成绩说明,谷歌这次的重点已经非常明确:
它想让Gemini从“聊天模型”变成“工作模型”。
不过也需要注意。
跑分成绩可以证明模型能力,但不能完全代表真实体验。
不同模型在不同任务中依然存在优势差异。
现在的大模型竞争,更像不同选手参加不同项目比赛。
更值得关注的是:谷歌已经让它干真实工作
相比实验室里的测试分数,谷歌公布的内部案例其实更有意思。
第一个案例,是优化数据中心资源。
谷歌表示,一组Gemini4Argon智能体分析服务器性能数据后,发现了内存优化机会。
相关优化部署后:释放超过300TiB内存。
后续预计释放规模:500TiB到1PiB。
简单来说:
AI已经开始帮谷歌自己优化基础设施。
第二个案例,是代码迁移。
谷歌正在使用Gemini4Argon辅助C/C++到Rust的迁移。
这类任务一直被认为非常困难。
因为底层代码不像普通应用开发,一个细节错误,都可能影响整个系统稳定性。
谷歌表示,相关修改经过自动化测试和人工审核,并不是AI自动完成全部替换。
此外,Gemini4Argon还参与优化开源视频解码项目libgav1。
其中涉及约:
3.2万行SIMD代码调整。
最终运行速度达到原Rust移植版本:
2.7倍。
这些案例释放出的信号很明显:
AI正在进入过去只有资深工程师才能处理的复杂任务。
谷歌这次,还有一个杀招:价格
除了能力,Gemini4Argon的价格同样引发关注。
官方公布:
输入:2美元/百万Token
输出:10美元/百万Token
缓存输入:降低95%
这个价格放在前沿模型里面,竞争力非常明显。
谷歌最大的优势之一,就是自己的算力体系。
现在它开始把这个优势转化成价格优势。
对于开发者来说:
调用顶级模型的成本,可能会继续下降。
现在最大的问题:什么时候普通用户能用?
Gemini4Argon当前并没有全面开放。
谷歌采用了分阶段策略。
第一阶段,通过Fairwind计划开放给部分网络安全防御团队。
之后,逐步开放给付费API用户和GoogleAIUltra用户。
原因也很直接。
这一次Gemini4Argon重点增强了软件分析和网络安全能力。
能力越强,开放时需要考虑的安全问题也越多。
谷歌这次,真的重新回到牌桌了吗?
Gemini4Argon的发布,至少证明了一件事:
谷歌没有退出AI竞争。
过去大家关注AI,更多是在比较:
谁聊天更自然,谁写代码更快,谁回答问题更准,但现在方向正在变化。
下一阶段,比拼的可能是:
谁能真正接手一部分工作。
未来我们使用AI的方式,可能会从:
“帮我写一份方案。”
变成:
“研究这个项目。”、“优化这个流程。”、“处理完告诉我结果。”
Gemini4Argon现在最大的问题,是谷歌什么时候愿意把它交到普通用户手里。
毕竟现在的状态有点像:
AI公司已经培养好了新员工。
但用户还在等入职通知。
热门跟贴