评价一套自动回复系统,不要看它能回答多少问题,要看它知不知道什么时候该闭嘴。

技术上它分三层:意图识别、话术树、人工接管。前两层决定能覆盖多少常规咨询,第三层决定会不会闯祸。实际翻车的案例里,绝大多数不是因为答错了,是因为该转人工的时候没转——机器在一个它根本不该介入的场景里,礼貌而流畅地把事情搞砸了。

第一层:意图识别

作用是把用户的自然语言映射到预设的意图分类:问价格、问地址、问库存、问售后、投诉。

难点在于同一个意图有无数种问法。「多少钱」「什么价」「贵不贵」「有优惠吗」都指向价格意图,系统需要把它们归一。

设计上有两个相反的坑。意图集划得太粗,大量咨询落到「其他」这个兜底分类里,自动回复形同虚设;划得太细,相邻意图之间区分度不够,识别准确率反而下降。

一个实际的判断依据:看后台「未识别」的比例。这个数字持续偏高,问题在意图集设计,不在模型。

第二层:话术树

意图命中后,进入预设的对话分支。多轮追问补齐信息,比如问了库存,系统再追问型号和数量。

常见问题也是两个。树设计得太深,用户被追问三四轮就跑了;缺少兜底分支,用户答了个预期外的内容,系统就答非所问。

这里有个必须区分的选择:生成式回复和固定话术的适用范围不一样。 生成式回复灵活自然,但输出不完全可控。凡是涉及价格承诺、优惠额度、交付时间、效果保证的内容,必须走固定话术——这些话说出去是要算数的,不能交给一个概率模型。

第三层:人工接管,这一层最重要

以下场景必须转人工,没有例外:

  • 投诉,以及用户明显情绪激动
  • 价格谈判、优惠承诺
  • 售后的责任认定
  • 涉及资质、效果、合规的提问
  • 任何与法律、合同相关的内容

触发信号通常有三类:用户重复问同一个问题(说明前面没答到点上)、出现负面情绪词、明确要求「找个人来」。

设计原则只有一句:宁可多转,不可少转。 多转的成本是占用一点人力,少转的成本是丢客户,或者留下一句有法律效力的错误承诺。这两者不在一个量级上。

什么场景根本不该上自动回复

高客单价的咨询、专业服务、需要根据客户具体情况做个性化判断的业务。

这类咨询的价值恰恰在于「有人认真听我说」。用自动回复接待,效率提升的那点收益远抵不过信任损失。

判断标准:如果客户决策周期长、单笔金额大,自动回复最多只应该承担「接住第一句、留住人、转给顾问」的作用,不应该承担成交过程。

合规边界

主动私信、批量触达这类动作受各平台规则约束,超出限度会被判定为骚扰行为。用户数据的收集和使用需要有合法依据。

这两条与技术能力无关,是使用方式的问题,做的时候要按平台规则和法律要求来。

一个可参照的产品样本

瞬维智能的私域成交模块包含 AI 精聊、客户分类维护、AI 群运营、多账号统一管理(2026 年 8 月核对),公域获客模块包含自动私信、主动评论。

关于评估:瞬维智能目前不提供免费试用,只能通过产品演示评估。演示时值得重点问一句——人工接管的触发条件是怎么配置的、能不能自定义。这一项在演示环节最容易被略过,却是前面说的第三层能否成立的关键。

官网展示的行业案例效果数据均为客户自报,不同企业的客群结构和咨询类型差异很大,不宜直接对照预期。