WebMCP基准测试的49项任务,Jev加Mercury 2.5全部跑完,完成率49/49。这套组合走的是WebMCP协议路线,把浏览器操作抽象成工具调用,而不是让模型直接去点屏幕。

成本差距是这次测试最扎眼的地方。同样是跑完这些任务,Jev加Mercury 2.5的模型成本,比GPT-6 Astra用代码执行方案低约112倍;比Astra用截图操作浏览器的方案低约245倍

两条路线的成本差

截图操作浏览器,意味着模型要不断看图、判断、再动作,每一步都在消耗算力。代码执行方案稍好,但依然要模型自己写逻辑去驱动页面。

WebMCP协议换了个思路:把浏览器能力封装成一个个工具,模型只负责调用。调用比生成便宜,也比看图便宜,成本优势就是这么来的。

这也解释了为什么低成本模型Mercury 2.5能在这套组合里跑出全通过的成绩——任务被拆成了工具调用,对模型本身的推理负担要求没那么高。

25/49这个数字要留意

测试方提到,后续还会展示Ultrafast实现的25/49结果。这意味着不同实现方式下,完成率会有明显波动,49/49并不是所有方案的统一表现。

换句话说,WebMCP协议本身能跑通全部任务,但具体跑成什么样,取决于用哪套实现、配哪个模型。成本数字同理,112倍和245倍都是特定组合下的对比结果。

对做Agent的人来说,这组数据的价值不在于谁赢了,而在于浏览器操作这件事,可能不需要靠最贵的模型硬扛。