打开网易新闻 查看精彩图片

最近AI办公这条赛道,在WorkBuddy跑出来后,肉眼可见的热闹起来。

阿里整合了QoderWork、悟空、MuleRun三个智能体,端出一个千问办公;字节把飞书并入豆包后,刚上线了工作任务模式,AI在虚拟桌面能像人一样查看电脑屏幕、移动鼠标、点击按钮、敲键盘,在电脑端操作Windows,果然还是对GUI路线爱得深沉。

这两天,华尔街投行杰富瑞(Jefferies)发了一份AI研究报告《China AI:US AI Cutting Prices》,除了跟踪模型智能排名与API价格变化外,还拿出相当篇幅,做了一件很少有机构做的事:

对中美市面上8款主流AI Agent产品进行了五项实测,并给出量化评分。

结果让人有点意外。

千问办公95分登顶,以微弱优势超过Claude Cowork和codex;WorkBuddy66分,跟谷歌Gemini Spark 分数一样,并列倒数第一,排排坐到小孩座;豆包77分,路边一条。

报告说,千问办公的底座模型智能分只排第四,但 Agent总分拿了冠军,所以核心结论是,“决定 Agent好不好用的是Harness,不是模型。”

Harness对于模型后训练能力提升和使用体验的重要性,早就是行业共识,这大结论虽然有点废话,但看着没毛病。

不过,浪哥有个习惯就是不只看结论,还要仔细看测试内容,结果这一看,却有了不一样的发现:

测试这玩意儿跟统计有点像,真是一门艺术呐。

打开网易新闻 查看精彩图片

我们一个个看。

这测试有五项,每项满分100,等权20%,加权平均就是总分。把千问办公和WorkBuddy的逐项成绩放一起看,就能看出玄妙之处。

测试一,多文件检索取证。任务是给一堆财务文件,写一页年报摘要,每条事实必须标来源,数字打架必须指出矛盾。这是有硬标尺的活儿,数字对就是对,错就是错。

结果是千问95,WorkBuddy95。

测试二,自主联网研究。任务是上网比较微软、Meta、谷歌三家的营收增速和资本开支,产出一张表,区分官方数字和自行估算。同样是有客观标尺的任务。

千问90,WorkBuddy90。

两项有客观标准的任务,千问和WorkBuddy分数完全一样。

然后看测试四,做一份五页的英文PPT。千问95,WorkBuddy80,差15分。

测试五,做一张营销海报。千问95,WorkBuddy 65,差30分。

PPT做得好不好,海报有没有创意,没有客观标准,打分的弹性空间比较大。评分细则没公开,盲评机制没说明,评分者一致性没有披露,这45分的差距从哪来的,没法验证。

但最有意思的,还是藏在中间的测试三。

测试三的任务是,让AI使用真实的桌面浏览器,从 OpenAI官网首页一路点进去,找到新闻页面,打开最新一篇文章,读完全文,输出一个包含标题、日期、分类、链接、摘要和要点的Word文件。

重点来了。规则明确写着,不许用API,不许用爬虫,必须真的操作浏览器去点。

这一项测试,千问办公拿了100分的满分,WorkBuddy跟MiniMax Code一样,都喜提零分。

看到这里,你浪哥笑了。

禁止API接口、必须点浏览器,这是人为把最优解砍掉,专门去测一个特定技术路线。这就是把“办公 Agent好不好用”,偷换成了“你家Agent有没有做 computer-use视觉操控”,但这跟“能不能做好办公任务”有毛关系呢?

就好比要考一个翻译的英语水平,但规定只能用手语表达,不许开口说话。

WorkBuddy走的是接口+生态集成路线,深嵌腾讯文档/企微等腾讯生态,靠连接器而非模拟点击去操作,靠API和MCP调用外部服务。现在这道题,把接口这条路直接堵死,只允许用视觉操控,接口派选手肯定直接归零。

倒是豆包,绝对要后悔读屏功能上晚了,没赶上趟,起个大早赶个晚集,很是可惜。

所以归因分解之后,千问成了大赢家,在两道能客观验证的测试上,跟WorkBuddy打平了,两道主观评判的测试上,比WorkBuddy多了9分,在一道“禁止用你最擅长的方法来做事”的测试上,WorkBuddy得了0分,千问得了满分,又拉开20分差距。

浪哥最近喜欢看一个厨艺综艺《一饭封神2》,这个测试看下来,感觉workbuddy真不容易,就像你去参加厨艺比赛,前两道菜评委说味道一样好,第三道菜规定不许用明火,只能用微波炉,你没有微波炉,零分。第四道第五道是摆盘比赛,评委觉得对面的盘子更好看,你又输了45分。总分出来,你是最差的厨师。

很多人说综艺节目有剧本,但估计没有任何一个综艺的剧本敢这么写。

而且这份报告里还有一个非常有趣的细节,提到了各家Agent的交付速度,在国内的办公AI里,WorkBuddy全场最快,千问办公全场最慢

但是呢,交付速度不在评分维度里面。不算分。

所以WorkBuddy干活最快这件事,在办公场景里当然很重要,但却进不了这套评价体系,就像一个大厨,风风火火把菜端出来,评委说小伙子你出餐速度挺快嘛,但我们今天不对外营业,比赛不考这个哦。

看到没朋友们,测试就是这么一门博大精深的艺术,学吧,学无止境,太深了。

这让浪哥想起一个老笑话。怎么证明大象是世界上最好的动物?很简单,出一份五项全能测试。第一项,体重。第二项,鼻子长度。第三项,耳朵面积。第四项,皮肤厚度。第五项,象牙质量。鲸鱼体重比大象重?对不起,这项规定必须在陆地上称。

只要定语足够多,谁都能拿第一。

当然,千问办公肯定是不错的产品。在两项客观任务上拿了95和90的高分,比豆包有一项拿了45分,不知高到哪里去了,这个没有争议。但一份评测的价值,取决于它能不能经得起拆开打量,很明显,这个不行。

不过虽然有点离谱,但考虑到是杰富瑞做的报告,倒也说得通。

杰富瑞刚发了一份看多阿里的投资报告,看涨45%,叙事线就是“阿里AI双轮驱动”,这时候再出一份评测,证明千问办公是全球最好的AI Agent,故事就讲圆了。

最近AI行业都在强调产品和大模型之间,可以形成一个互相促进、彼此强化的协同飞轮。看上去,杰富瑞也学会了这一套协同飞轮了,买入评级配合评测报告,一套动作衔接起来,确实是无比丝滑。

打开网易新闻 查看精彩图片