打开网易新闻 查看精彩图片

谷歌也做agent 了,底气居然是Claude给的。日前,Google Cloud发布了新的Gemini Agent。名字叫Gemini,但碰上难搞的任务,它还可以调用Claude。

打开网易新闻 查看精彩图片

在Agent圈,Claude老祖已经成了香饽饽。就在前一天,马斯克刚刚宣布Grok Bot今后会根据任务选择最合适的模型,名单里同样有Claude。

谷歌尤其需要一点外援。

一周前,谷歌刚端出新一代旗舰模型Gemini 4 Argon,榜单刷得很漂亮,奈何并未向公众开放。根据报道,它的实际表现与外界对谷歌的期待相比,还是差点意思。

模型赛道没能打出一个漂亮的翻身仗,Agent这边倒是突然热闹起来:Meta的Muse刚刚带火了个人Agent,一条新的弯道,摆在了谷歌面前。

谷歌能借着Agent实现弯道超车吗?恐怕没那么容易。

不过上路试试总比像苹果那样僵立不动强,至少这条新赛道还没来得及给谷歌来上一套熟悉的连环暴击。

01

谷歌终于拿出了一个像样的Agent

认真说起来,谷歌可能是全世界最适合做Agent的公司之一。

如果把一个Agent需要的东西摊开来看,模型、工具、数据、执行环境和用户入口,谷歌几乎什么都有。

尤其是,谷歌拥有一整套经营了20多年、并且已经牢牢占据了用户心智的办公产品。

从Gmail、Calendar到Docs、Sheets、Drive,再到团队使用的Google Chat,很多人的工作本来就在谷歌的生态里完成;其他公司的办公Agent想要真正替用户干活,很多时候也绕不开谷歌。

在其他Agent纷纷接入谷歌的产品之后,谷歌也终于开始认真利用它的这份家底了。

当地时间10月8日的Gemini at Work大会上,谷歌云CEO Thomas Kurian正式介绍了新的Gemini Agent,试图把Workspace里原本分散的应用、数据和工作流程组织成一个统一的工作Agent。

打开网易新闻 查看精彩图片

比如,你只需要告诉它:“帮我约一下上次活动的几位负责人。”

Gemini Agent就可以结合此前的邮件、群聊和日历记录,在授权范围内找到相关人员,检查时间,再发邮件协调会议。用户不用重新告诉他每个人是谁,也不需要挨个打开应用操作。

凭借谷歌强大的生态,Gemini Agent可以直接进入谷歌应用的工作流程。在Gmail里,如果老板发了邮件,要求把最新项目进展整理成PPT,Gemini可以主动识别任务,并提供一键委托的入口。它也可以在Docs里修改文档,在Chat里响应任务,跨应用工作时保留相同的上下文、记忆和技能。

当然,跨应用执行、长期记忆、云端运行,在整个AI圈里算不上什么新鲜功能。Meta的Muse能通过专属云端电脑和浏览器替用户购物、发邮件、安排出行; OpenAI的Dots同样拥有独立云电脑,可以连接用户授权的应用,在用户离开后继续推进任务。

谷歌真正的优势在于,Gemini Agent的能力可以直接与现成的企业协作体系相结合。

除了作为个人助手,Gemini Agent还可以变成一名长期工作的团队成员。谷歌把这种形态称作Coworker Agent,用户只需要描述希望它承担什么岗位,Gemini就能创建一个拥有固定职责和独立身份的AI同事。

举个例子,市场团队可以创建一名负责活动协调的Agent。这个Agent会获得自己的Workspace账号,包括邮箱、日历和Drive储存空间。

它甚至可以出现在公司的通讯录里。同事可以像找其他员工一样,在Google Chat里@它分配任务,或者在Docs子评论区要求它修改文件。

再加上谷歌云和BigQuery等数据基础设施,Gemini Agent还可以连接企业数据库,调用分析工具,甚至根据公司已有的业务指标和定义生成报表。

谷歌因此有机会把Agent的工作范围从员工日常使用的办公软件,进一步延伸到企业后台的数据和业务系统。

打开网易新闻 查看精彩图片

顺便一提,微软同样拥有Microsoft 365和Azure这样的完整生态,它甚至更早把Copilot放进了办公软件。但做了这么多年,微软也没能把分散在各个产品里的AI能力彻底整合起来。

该说不说,家底厚归家底厚,能不能把这些资源真正用起来,是另外一回事。

这一次,谷歌还有一个非常值得肯定的地方:它这回想得挺开,意识到了自家的Gemini未必能包办所有事情。

于是,它把Claude老祖也请来一起干活。

Thomas Kurian在官方介绍里明确表示,Gemini本身是一个智能体,其背后的具体模型可以自由选择。它会根据任务的性质选择更合适的模型来完成任务。

目前,Gemini Agent可以在自家的Gemini和Anthropic的Claude之间调度,未来还会支持其他模型。

打开网易新闻 查看精彩图片

官方给出的解释倒是挺好听,说最强的模型可能隔几个月就换一家,不同任务不一定需要同样的模型,灵活选择供应商还能兼顾效果与成本。

但实际上,即使在谷歌自己刷的漂漂亮亮的评测表里,Gemini 4 Argon在Terminal-Bench 4.0上只拿了57.4%,Claude Opus 5.5却有66.4%;FrontierSWE v2上,Argon同样以55.0%落后于Claude的62.3%。(第三方独立评测的数据有些不同,但我们先看谷歌自己的榜单。)

至少在部分复杂编程和Agent任务上,谷歌还真没能赢过Claude。

打开网易新闻 查看精彩图片

而据《商业内幕》10月9日的报道,一位谷歌员工认为,早期测试的Argon在部分Coding任务上,甚至落后于上一代的Claude Opus 5。

谷歌这次也算给自己留了条后路:碰上自家模型啃不动的硬骨头,好歹还能摇人。

打开网易新闻 查看精彩图片

谷歌云其实此前就允许企业开发者使用Claude,不过这一次,它把多模型选择进一步带进了自己提供的通用工作Agent。

至少在这条企业产品线上,谷歌开始明确把Agent本身的竞争力放在了自家模型的独占性之前。

这一步,我觉得值得肯定。

02

谷歌为什么总是慢一步

不过话说回来,谷歌以前难道没做过Agent吗?

早在2024年12月,谷歌就推出了Google Agentspace,把Gemini的推理能力、谷歌搜索和企业数据整合起来,让员工能够跨系统搜索信息、创建和使用Agent。

2025年4月,谷歌又推出Workspace Flows,让用户可以用自然语言创建自动化工作流。比如收到客户反馈后,AI可以自动读取表单、分析问题、查找解决方案,再生成回复,交给客服审核。

到了去年10月,谷歌干脆把Agentspace整合进新推出的Gemini Enterprise,试图打造一个统一的企业AI工作入口。

从企业搜索、跨应用自动化,到Agent的创建和调度,谷歌早就证明了自己有这个技术。

可问题是,别人已经用Manus、Muse等产品建立起了鲜明的Agent产品认知,谷歌却始终没能拿出一个同样出圈的代表作。

今年5月的Google I/O大会上,谷歌倒是也推出了个人Agent Gemini Spark,但这一炮打出去,几乎没激起什么水花,和哑炮也没太大差别。

打开网易新闻 查看精彩图片

该有的东西谷歌都有,却迟迟没有做出什么名堂。

对熟悉谷歌的读者来说,这种剧情讲真一点也不陌生。

回头看过去几年,从通用大模型到Chatbot,再到如今的Agent,谷歌似乎总赶不上一口热乎的。

2017年,谷歌的研究人员提出了Transformer架构,为后来的大语言模型奠定了重要基础。

论研究,谷歌有DeepMind这样的顶尖团队。论算力,它很早就自研TPU。再加上充足的资金和庞大的产品生态,它几乎找不到明显的短板。

结果到了通用大模型时代,OpenAI先用GPT系列打出了招牌。

早在2019至2020年,谷歌的工程师Daniel De Freitas和Noam Shazeer就已经在内部开发出一款对话机器人。两人很早就看到了Chatbot的商业潜力,还多次推动谷歌把产品开放给外部研究者,接入Google Assistant,甚至直接公开演示。但谷歌管理层始终没有点头。

有意思的是,Shazeer后来离职创办Character.AI,2024年被谷歌通过一笔27亿美元的技术授权交易请了回来,今年6月又一次离开谷歌,转投OpenAI。

结果2022年底,ChatGPT又抢先引爆了消费市场,打开了Chatbot的时代。

谷歌随后匆忙应战,甚至有些过分着急。2023年2月,谷歌的Bard还没正式向公众开放,就已经因为宣传演示中的一道错误回答闹出了笑话,叠加当天发布会表现不及预期,谷歌母公司Alphabet股价当天大跌,市值蒸发约1000亿美元。

当然,后来的Gemini在模型能力上确实追了上来——追上了一段时间——谷歌的AI业务也并没有到失败的程度。

但有趣的地方就在这了,谷歌似乎总能提前掌握通往下一代技术的门票,却很难成为第一个把新产品做火的人。

以前是模型和Chatbot,现在轮到了Agent。

论技术、资源和用户基础,谷歌每次都算是最有希望的选手之一。可真到了市场竞争的时候,它又常常变成追赶者,跟在别人的屁股后面。

我觉得,这可能也是老牌科技巨头共同的难题——他们主观上是想要做成事的,只是尾大不掉,容易被组织拖累。

老牌公司并不缺人才、技术或者决心,甚至可以认为,恰恰是过去几十年的成功,让他们建立了一套庞大、成熟又很难轻易改变的组织体系。

但问题在于,Agent要做的恰恰是打破不同产品之间的边界。

对于创业公司来说,做Agent是从头设计一款新产品,接入别人的生态;但对谷歌这样的巨头来说,则意味着要重新组织自己过去20多年积累的产品和业务。

业务越成熟,转型起来就越困难。一个新的功能能否推出,不仅取决于技术上能否实现,还要考虑原有用户是否接受、是否会影响已有的业务,以及出了问题该由谁来负责。

有顾虑是合理的,但等大公司把方方面面都考虑清楚,市场可能已经被别人抢先占领了。

除了谷歌和前一部分提到的微软,亚马逊和苹果也有类似的问题:

亚马逊早在2014年就把Alexa送进了千家万户,背后还有AWS、电商和庞大的智能家居生态,但到了大模型时代,Alexa+却经历了漫长的开发和上线波折,始终没能像ChatGPT一样掀起新的产品浪潮。

苹果更不用说,手握数十亿设备、完整的软硬件生态和Siri这个现成入口,却在新一轮AI竞争中有心无力,原本承诺的个性化Siri一再延期,直到今年才正式推出大幅升级,而且还是预览阶段。

这些巨头明明早早拿到了入场券,却常常要花更多的时间,才能真正挤上车。

当然,我们不能把所有问题都归咎于大公司的组织臃肿。但至少从过去几轮AI产品竞争来看,谷歌在技术储备和产品表现之间,始终存在着一种颇为尴尬的落差。

如今,Muse、Dots等产品已经把长期工作的Agent推到了台前,Grok Bot也开始强调根据任务选择合适的模型。

谷歌这次拿出的Gemini Agent,至少在产品思路上跟上了这一轮变化,开始把分散的办公应用组织起来,同时允许外部模型参与执行任务。

只是目前发布的Gemini Agent,和之前的Gemini 4 Argon一样,还只是面向部分客户的私人预览阶段。

谷歌在发布会上展示了很多能力,但产品究竟行不行,现在还没有答案。

想靠Agent实现弯道超车,谷歌值得一试。不过眼下最要紧的,恐怕是先把车从发布会开到用户手里。

03

Claude老祖,正在成为Agent公共底座

在找外援这件事上,谷歌和马斯克不约而同地选择了Claude。

打开网易新闻 查看精彩图片

这就很有意思了,谷歌有Gemini,马斯克有Grok,两家公司都在花大价钱训练自己的模型,可真到了做Agent的时候,却都愿意请Claude来“坐阵”。

看起来,到了Agent时代,谁家的模型最好用,和谁家的Agent最好用,开始变成两回事了。

其实想想也不奇怪。Agent本来就给那些模型暂时不够强的玩家提供了一次弯道超车的机会。

Meta的Muse就是个现成的例子,它背后的Muse Spark并没有统治模型排行榜,却不妨碍Muse成为今年最受关注的个人Agent之一。

当然,Meta选择了用自家的模型支撑Muse。但对谷歌、马斯克来说,既然Agent的竞争力不再完全取决于底层模型的排名,又何必非要被自己的模型绑死?

谁的模型好用,就调用谁的。自己擅长的任务自己做,没那么擅长的就交给别人。

至少在Agent这条赛道上,能不能把活干好,开始比是不是自家模型干的更重要。

对谷歌这样的公司来说,它不必等到Gemini在每一个领域都拿到第一,才有资格做出一款好Agent。

而对Anthropic来说,当越来越多Agent开始自由选择底层模型,Claude就有机会成为这些产品共同使用的一套基础能力。

谷歌和马斯克都点名Claude,首先当然与模型实力有关。尤其是在编程、工具调用和复杂任务执行上,Claude已经积累了相当强的竞争力。

以Vals AI 10月7日更新的Terminal-Bench 4.0独立排行榜为例,Claude Opus 5.5拿到了65.15%的成绩,Claude Sonnet 5.5紧随其后,Gemini 4 Argon则是57.58%。

打开网易新闻 查看精彩图片

虽然单项评测不能代表所有场景,但至少在Agent最需要的部分能力上,Claude的口碑可以说是相当权威。

如果看更综合的智能水平,在Artificial Analysis的Intelligence Index里,榜单前三分别是Opus 5.5、Sonnet 5.5和Fable 5.1。

打开网易新闻 查看精彩图片

而且,Anthropic还在主动把Claude变成开发者构建Agent时最顺手的选择。

Claude Code就是最好的例子,从一款编程Agent开始,Anthropic正在逐渐把Claude Code背后的工具调用、上下文管理、权限控制和多Agent协作能力,开放给其他开发者。

去年9月推出的Claude Agent SDK,已经让开发者可以借用Claude Code的底层框架,去搭建自己的Agent。到了今年10月1日,Anthropic又给Claude Code开放了Mods。开发者可以用少量TypeScript代码修改它的行为、界面,甚至替换内置功能,并通过插件分享给其他人。

打开网易新闻 查看精彩图片

几天之后,Anthropic又开始给开发者“发钱”。

10月6日,它宣布扩大Claude Startups计划,为符合条件的创业团队提供一年Claude Team、1000美元API额度,以及其他开发资源和支持;10月7日,Claude Max和Team订阅用户也开始获得每月API额度,可以拿去调用Claude模型、使用Agent SDK,或者运行自己开发的Agent。

打开网易新闻 查看精彩图片

从开发框架、插件生态,到直接补贴API调用,Anthropic正在想办法让更多开发者围着Claude构建产品。

一个开发者用Claude做出了Agent,下一个开发者就可能沿用他的工具、代码和经验;做在Claude上的产品越多,后来的人选择Claude也就越方便。

当然,这不意味着Claude已经垄断了Agent的底层市场。

模型能力和价格变化很快,谷歌强调多模型调度,某种程度上就是为了避免被任何一家模型厂商绑住。今天Claude最适合的任务,明天也可能交给GPT、Gemini或者其他模型。

但这恰恰也是Anthropic需要提前经营开发者生态的原因。

当然,OpenAI也没闲着。

论模型的智能水平,GPT和Claude其实没有拉开特别大的差距,在不同任务上各有优势。而且OpenAI同样在争夺Agent的底层市场。

但OpenAI还有另一重身份:它自己也是Agent市场的竞争者。

DevDay上,OpenAI刚刚推出了常驻Agent产品Dots;10月9日又更新了移动端创建功能,用户现在可以直接在ChatGPT手机App里创建自己的Dot。

打开网易新闻 查看精彩图片

Anthropic当然也在做自己的Agent产品,但OpenAI的Dot已经直接进入个人助理和办公Agent市场,和谷歌、马斯克想做的事情有了更多重叠。

更何况,OpenAI的“人缘”似乎也没Anthropic那么好。

谷歌和Anthropic有长期合作关系。双方在模型供应、云计算和TPU算力上已经有不少商业往来,Gemini Agent选择Claude,有现成的合作基础。

而在马斯克那里,他和OpenAI的官司都还没打完,想让Grok Bot主动请来GPT帮忙,恐怕还需要一点额外的想象力。