David Pawlan 上线了一个叫 assistantbenchmark 的评测站。他把 71 款消费级 AI 助手拉进 15 个真实生活场景,测的不是模型多大,而是事情能不能办完。

考的不是聊天,是收尾

打开网易新闻 查看精彩图片

这些任务都带着明确的终点:订酒店要一路走到结账页,梳理医疗账单并向保险公司申诉,航班延误后追回上千美元赔偿,还有打电话确认线下门店的库存。

换句话说,评测的判分线不在对话里,而在任务有没有真正落地。

卡住的地方很具体

结果显示,聊天里口若悬河的大模型,到了真实办事场景中大半失败。原因并不玄乎:

打开网易新闻 查看精彩图片

  • 拿不到登录态,进不去需要账号的页面
  • 处理不好异常,流程一偏离预设就断掉

能说会道和能办成事,在这里被拆成了两件事。前者靠语言能力,后者要靠一整套在真实环境里推进流程的本事。

克制反而成了门槛

评测给出的一个判断是,克制与分寸感成为关键壁垒。在需要登录、需要申诉、需要打电话的场景里,做得多不如做得准,越界一步就可能让整个任务失败。

71 款助手同台,比的不是谁更会聊,而是谁能在真实世界的摩擦里把事办完。