打开网易新闻 查看精彩图片

AI 办公卷成什么样,我电脑的风扇最有发言权,打游戏都没这么热,全是让 AI 干活烧的。

WorkBuddy、千问办公、豆包工作、百度搭子、库库AI,这几个产品我天天轮着用,任务一个接一个跑,风扇没停过。

用了一段时间,一个很直接的感受:工具都能干活了。这看起来是好事,不过,对四家公司来说,麻烦才刚开始。

人人都有铲子时,铲子就不是护城河了。

给 WorkBuddy 派一句「把这堆材料整理成周报」,它自己拆步骤、调度、交付,手脚麻利,编排效率是五家里最舒服的。

千问办公的交付最省心,模型底子厚,同样一份研报,别的家交三版还要返工,它一版基本能定。

豆包工作,目前我看到最像样的是操作本地电脑。我电脑里有几年积累的照片,苦恼了我很久,上周半天时间,它给我该归档的归档,该整理的整理。

它甚至能区分哪些是精修过的、哪些是原片,这个能力别的家还真比不了,可能是多模态的作用。

百度搭子最近做了套件。

如果你做自媒体,需要做选题策划,它从热点到初稿到配图,全都给你整理明白,直接交付结果。

库库AI 目前的金融垂类最准,它长在百度文库、网盘的数据上,我每天拿它给财报做双重校验,错漏比想象少。

五款试下来,各有各强项,没有一家全能的。产品还越长越像:

豆包工作照着 WorkBuddy 摆了三栏式布局,WorkBuddy 有专家、技能,豆包工作就配了技能和伙伴,连名字都懒得换。

形态趋同只是表象,动作上的趋同更吓人。

7 月底到 8 月初,一个月内三家同时收兵。海外也是这个节奏,微软、Anthropic、OpenAI 在 90 天里先后把同类产品推向市场。

行业第一次出现这么整齐的动作,所有玩家都在把散落的产品收拢成一个入口。

同一个月收兵,这在互联网大厂的竞争史上都少见,收拢的意思是,单点功能不再值得投入,入口才是战场。

入口这个词,四家从四个完全不同的地方出发的。

腾讯从社交出发。WorkBuddy 的底子是腾讯云的编程工具;它的钥匙,是微信和企微里那 12 亿人。功能可以抄,这 12 亿人的关系链抄不走。

阿里从组织出发。钉钉沉淀的2600 万家企业组织,是它最硬的底牌;审批、考勤、知识库都长在钉钉里,AI 要替企业干活,绕不开这张组织地图。

智远认为,百度的牌有两张。

一张从数据出发,文库 18 亿份专业文档,网盘里堆着用户的私域文件,库库AI 长在这堆数据上。

另一张从桌面出发,百度搭子(DuMate)的定位是第二大脑加执行助理,切入桌面操作系统,跨应用操控,什么都接,拼生态广度,一句话总结,会干活的通用桌面助手。

经常有人问我它俩有什么区别,我理解的是:一个吃垂类办公赛道,一个吃生态。

字节从上下文出发。豆包工作继承飞书里的聊天记录、文档、会议纪要,它赌先读懂你的工作,再替你干活。

四个出身,钥匙各不同,都能干活,活法完全不同。

起手牌不一样,打到 8 月底,牌局是什么样?

6 月桌面端访问量,易观数的 17 款产品加起来 6000 万次,年初这个数字还是 2000 万,半年翻了三倍。

腾讯系 53.8% 排第一,WorkBuddy 一家 2097 万,超过第二名和第三名之和,全平台月活 2000 万,日活 1300 万。

字节系 23.8% 第二,靠 TRAE 和扣子撑着;阿里系 15.2% 第三,百度排第十二,72 万,上榜的还是搭子。

这里我要说一句,访问量这个东西能刷能投流,当个参考就可以,没必要在这里计较,甚至把它当成判决书。

我又查了一下,8 月 19 日,美国投行杰富瑞(Jefferies)给 8 款主流 Agent 出了一张卷子,五道真实办公题:

多文件年报摘要、联网比对经营数据、操作真实浏览器查资料、按数据做英文 PPT、照参考图做营销海报。

这份报告不是刷榜刷出来的,分析师把真实办公任务一道一道跑一遍。

结论是:

千问办公 95 分第一,全场唯一一个所有科目都在 90 分以上的;Claude Cowork 94 分第二;Codex 92 分第三;Kimi Work 86。

豆包 77;MiniMax Code 71;WorkBuddy 和 Gemini Spark 都是 66,并列垫底。

流量第一的 WorkBuddy,考分垫底;考分第一的千问办公,背后阿里系流量只有第三,出身和名次,对不上。

说到底是两本账:流量是分发能力的成绩单,考分是干活能力的成绩单,各家各考各的,互相做不了数。

更狠的是,这张考卷把老逻辑也掀了:

飞书、钉钉用十年时间攒下的那套评价体系,正在失去定义权;一个不绑企业微信、不靠组织关系、从编程工具里长出来的产品,四个月冲到流量第一。

拆开看就明白了:

杰富瑞把考分拆成了两层。一层模型本身的智商,一层模型外面那套工程机制,它叫 Harness,管的是指令怎么下、上下文怎么组织、工具怎么调用、边界怎么控制、错了怎么纠正。

千问办公的底座模型 Qwen 3.8 Max,智商分 56,排第四,但加上 Harness,总分直接到 95,工程硬生生补了五六分。

反过来,WorkBuddy 的 Harness 分在国内五家里垫底。

同一个模型,换一套 Harness,实测差距能有 18 个百分点,这是杰富瑞拿同一个模型换班子测出来的。

名次早就轮不到模型智商说了算,模型外面那套工程,才是真正的考卷。

报告还算了成本账:Qwen 3.8 Max 的 API 价格,只有 GPT-5.6 Sol 的四分之一;Agent 干长活要烧很多轮 token,这一项成本差距,会越滚越大。

这个拆法,跟我用下来的体感对得上。

豆包工作考分 77 不上不下,差在基模,我写财经稿,一个完整工作流要跑好几轮,越到后面几轮,偏差越明显,会幻觉,会阉割内容。

百度搭子交付慢,等得人心焦;库库AI 金融做得准,但 agent 调度效率也低,主观感受,大家都会遇到这个问题。

各有各的短板,没有一家把六个科目全考满;注意啊,我说的仅代表个人体验,没有黑谁的意思。

所以,现在名次,只是个人市场的名次;桌面端的流量,是个人一台电脑一台电脑用出来的。

我摊开中美这些数据和测试,并非要给谁发奖状,AI 办公这东西,谁用谁知道,体感差得很远,但有一点是确定的:

个人用着顺手的,和公司愿意买单的,是两回事。

我看了一份海外今年的调研,说:1/5~1/3的员工在用公司没有批准的AI工具,45%的人在公司电脑上常规都会用AI。

这个没什么可质疑的,大部分人现在上班,自己掏钱买订阅,公司没有报销的;谈不上员工不守规矩,是需求先于流程,活要干完,工具自己找。

对四家来说,影子 AI 现成的需求:

员工已经替企业把工具选好了,企业要做的只是收编,发企业版账号、接权限、立规矩,这是四家企业版存在的意义。

员工先用起来,企业后知后觉,等发现的时候,工具选型已经被用脚投过票了。

企业这边呢,开的比较慢。

国内工业企业今年二季度的数据,大企业的 AI 采用率 19%,小企业只有 3.4%;信通院今年 3 月发布的报告,6000 多家中小企业里超半数已经在用 AI,但只有 4% 做到全流程嵌入。

四家都在门口站着,是门里的路还没修好。

而且门和门不一样,韩国今年 6 月的一份调研很有意思:大中小企业用 AI 的差距有 13.8 个百分点,但把公司的支持体系补齐,差距缩到 4 个点。

门锁在于都没准备好。三种门,三种进法:

已经用上的大企业采购直接走招采,要私有化的,主要是关注合规问题。

正在转型,想用AI办公的,是最热闹的部分,此前钉钉、飞书打了好几年,遇到的同类问题,在AI办公这个产品上也会同样遇到。

至于还没有入门的中小企业,索性叫小组织吧,价格最敏感,一个68块钱的订阅,几十个人可能要掂量好几天。

4 家 4 把钥匙,各开各的门。

阿里对大企业门,考分第一,钉钉攒下的组织底子就是门路。

腾讯对中小和连接型的门,企微能直接加客户微信,这是另外三家没有的门路,可腾讯到现在都没把 WorkBuddy 和企微真正打通。

有媒体分析说:

腾讯擅长连接人,对组织管理的理解积累有限,这张牌不是不想打,还没学会怎么打。

字节对转型中的门,飞书客户是小米、理想这种正在重做流程的公司,客单价高,赌原生调度层。

百度呢?

库库AI和搭子都想进入组织,切哪一块,我目前还没有想到;中小企业、中小组织是不是更合适的切口?我也在琢磨。这是一个从哪切入的问题。

金山不算四极,但它是另一个物种:

37 年文档技术,从编辑器里长出来。它的企业生意不声不响做得不小,WPS 365 今年上半年收入 4.97 亿,连续六个季度增速超 60%。

客户名单是中核、中石油、兴业证券这种央国企,组织级 AI 入口 WPS Comate 已经落地 11 大领域 26 个场景。

其他家要挤进组织的门,金山不用,它本来就在屋里,办公软件装了三十多年,AI 是原地长出来的:编辑器里内嵌一套,独立 Agent 一套,组织入口再一套。

不过,做是做出来了,还没在组织里真正跑起来。

沙丘智库今年的调研,企业采纳率从 2024 年底的 17.3% 涨到 2026 年中的 40.3%,但还没有一家达到完全就绪的大规模商用。

毕马威中国的 AI 转型主管这个月还在说:

没有企业敢用 AI 生成标书去竞标。海外一样,微软今年公布的数据,4.5 亿 M365 用户,付费 Copilot 只有 1500 万席位,渗透率 3.3%,就是进不了组织。

住进去要花钱,花多少、怎么花,现在还没有标准答案。

先问钱谁来出。

企业老板还在纠结,雇更少的人买更多的 AI,还是雇更多的人买更少的 AI;员工也有自己的账,提效了,省下的时间未必归自己。两本账,都没算明白。

我个人觉得,订阅制这套玩法,进了组织可能就算不过来了。

个人订阅是固定额度,一个月几十块,用多用少封顶。组织里的 AI 24 小时干活,风控要 24 小时盯着,Token 烧起来没谱。

按固定价卖,要么厂商亏,要么用户亏,总有一边是要掀桌子的。

我看金山的人也说过这个问题,订阅制和按量取费会长期并存。

海外已经在改了。Anthropic 的企业版,20 美元一个席位的月费只买平台和管理,所有用量按 API 价格另算,没有额度上限,一家 800 人的公司,评估下来一年能到百万美元级别。

OpenAI 的企业版没有公开价,走销售报价,按年签单;微软按 Credits 计费,明码标价;三家没有一家靠纯订阅进组织的。

国内政企是另一套账本,要私有化部署,钱分成四块:

软件授权费,几十万;GPU 服务器,四五十万起步;定制开发,按人天算;还有每年的运维费。

钉钉当年做专属版,光实施费就要几十万,每年运维再来一二十万;这一套换到 AI 办公上,多半也要重来一遍:部署完之后,订阅基本没人买了,按量才是持续的大头。

在这套账本之外,百度还试了第三条路。

这个你说它是办公赛道吧,也不算,但也算ToB的,就是伐谋。

大型客户直接项目制,一个项目周期三年;中型客户公有云按量收费;定价不看 Token,看价值,帮一个十亿产值的厂提 5% 的产能,就是五千万增量。

青岛港那种全球最先进的码头,伐谋迭代了近四百轮算法,把调度指标再提 10%,这种活按订阅卖,没人敢这么报价。

伐谋的人说,Agent 的价值在它帮客户多赚了多少钱。你说这能归属到AI办公里面吗?

组织怎么为 AI 付钱,全球都还没有标准答案,人人手里都有铲子,可企业的门,到底谁能先进去?是一张新的考题。

数据来源:

[1].易观《2026年二季度中国办公智能体市场报告》、杰富瑞全球 Agent 实测报告(2026年8月19日)、沙丘智库、大韩商会、长江商学院工业企业调研、金山办公2026年半年度报告及各公司公开发布;文中观点、产品体验均为个人实测

打开网易新闻 查看精彩图片