如果AI的准确率能做到90%,剩下的10%,谁签字?
上周末我参加了一场沙龙,创小融和「财AI客厅」办的「AI非共识实验室」,主题就很反AI大会:AI进入脏活累活之后,到底还有什么机会?
一下午聊下来,我把现场的讨论和自己做项目踩过的坑合在一起,整理出了一张检查清单。我管它叫《FDE场景准入四问》——一个AI想法,如果回答不了这四个问题,就建议先别上。
先说现场聊到的几点启发。
90%准确率,老板为什么还是不敢用?
这个话题来自对AI处理数据准确率的讨论。现场有人展示了AI参与审计和数据处理的想法。随后一位嘉宾提到:
以前的财务软件虽然复杂,但计算逻辑固化对了,后面可以一直按同样的规则跑。而AI每次都有可能错。就算准确率到90%,企业敢用吗?剩下的10%谁检查?AI做完还要加一个人复核,省下的工时还剩多少?一旦出错,谁签字,谁担责?
讲到这儿,话题开始从技术讨论,变成了企业经营问题。
这是真干过的人才能提出的问题。很多企业看演示时很容易被数字打动:准确率90%,速度提升一倍,几分钟干完过去几小时的活。听起来很唬人。
可一旦把AI放进财务、审计、合同审核、供应链这类业务,老板要问的还有后半句:那10%的错误会出在哪里?
如果只是内部参考,错一处改掉就行。可如果算错一笔账、漏掉一条合同风险、给错一次补货建议,损失可能远超省下的工时。
现场有句话让我很有共鸣:企业里只要结果需要签字,就一定要有人对它负责。
我做知识库项目时也一样。搭完问答智能体只是开始,还要整理真实业务问题、做评测集、检查答案来源,确认哪些问题允许模型直接答,哪些必须由业务人员复核。
我现在评估企业的AI场景需求,除了确认实现逻辑,还会追问三件事:允许错多少?错一次的代价有多大?人准备在哪个节点复核?
这三个问题不清楚,90%只是一个好看的平均数。
尾款难收,是前面欠的债
活动中有人聊到AI项目尾款难收。这个话题一出来,在场做交付的人都无奈苦笑。
大企业的回款流程其实很正规,只要里程碑完成,钱总会往下走。难点在于:AI项目的里程碑怎么写?
客户说想做个知识助手,合同里也写"完成一个知识助手"。可做到什么程度算完成?能创建出来算吗?能回答几个问题算吗?业务人员真用过才算吗?试用后提的新需求,多少算原来的范围?
我自己就吃过这个亏。
有个项目沟通交付了很多轮,到了结项阶段,我们还在重新翻会议记录、文档、反馈,对着工时一条一条跟客户解释:哪些工作做了,哪些变化超出了最初的约定。那个下午我一边整理一边想,这些事要是签合同那天就谈清楚,双方就都不用这么折腾了。
现在回头看,尾款只是最后显出来的结果。前面真正缺的,是一套双方都认的验收办法。
知识助手要提前约定:用哪些真实问题测试、答案准到什么程度、出处能不能点回原文、资料里没答案时怎么处理、谁试用、谁有权确认通过。
开发前把这些谈清楚,项目启动会慢一点。但后面少改几轮、少争几次,时间很快就省回来了。
有些步骤,真的不需要AI
现场一位长期做供应链软件的嘉宾,分享了一条我很认同的实施原则:
底层能确定的流程和规则,先固定住,不能都让AI来猜。大模型更适合处理异常、理解不标准的表达,以及在多个方案之间做判断。
比如算税额、校验字段、执行固定审批条件,这些有明确公式和规则的事,用代码、工作流去做反而更稳。
AI更合适的位置是:员工说"来瓶可乐"、"补一点货"时,能识别这种随口的话背后对应哪个商品、哪个仓库、多少数量。这种表达太随意,规则列不完,正好让模型理解意图、提取参数,剩下的计算交给代码。
我在现场也补了一句:如果一项数据测算从头到尾都有模型参与,即使任务拆成很多层,也没法保证每次结果完全一样。真要上线,得拆开——能写死的逻辑写死,需要理解判断的地方用模型,后面留一道复测或人工确认。
我见过不少项目,为了显得"AI Native",恨不得每一步都塞一个Agent。看起来很NB,背后则是随机性、调用成本和排查难度一起等着和你算账呢。
我的判断是:FDE进入企业后的第一个关键决策,是把AI从几个不该出现的节点上拿掉。
新问题如果比原来的问题更贵,这套方案就没有创造价值。
AI来了,才想起补三十年前的课
有位做了30年财务的嘉宾,梳理了企业从信息化、标准化、数字化走向AI的几个阶段。他的观点是:信息如果还留在口头、纸面或少数人的电脑里,各部门对同一个数据没有统一口径,AI就没有可以稳定使用的基础。
后半场聊到项目时,这个问题又冒出来一次。
有人吐槽:客户总觉得自己的数据没问题,只差一个架构师。架构搭好了,AI自然就能跑。而真正做过交付的人只是笑笑——我们花掉的大部分时间,还是在帮企业做数据治理。
我也不例外。
最近一个知识库项目,客户给了上百份文档,看上去资料很齐。真正处理时,重复版本、失效文件、错位表格、识别不出的图片、丢失的页码,一个一个全跑出来了。有些文件名里还带着"最终版""最终确认版""最终肯定不改版"。
结果呢?哪个版本有效,得有人确认。图片缺了,得补说明。表格切错了,得人工修。最后入库的每一份资料,都得有人对它负责。
很多AI项目还要对接客户内部系统,坑更多。一个合同审核助手单独能跑通,只说明它有审核能力。但客户要的是它进自己的OA审批流:能对比新旧合同、修改意见能回写、原来的审批人还能继续签字。
这时候FDE做的,是和客户约定接口格式、数据交互逻辑——全是AI之外的活。
数据治理、流程梳理、接口对接、权限配置、业务试用、问题整改、评测验收,这些大家口中的脏活累活,才是AI能不能跑通的根基。
企业主看到的只是个对话框,FDE看到的,是它背后有没有一条完整的业务链。
四个问题,回答不了就先别上AI
活动结束,我把讨论和自己的项目经验合在一起,整理成四个问题:
第一,这个场景想改变什么业务结果?谁会每天用它?
第二,哪些步骤可以固化成规则?哪些步骤确实需要AI判断?
第三,AI出错会造成什么损失?谁复核?谁负责?
第四,准备用哪些真实样本测试?做到什么程度才继续往下投钱?
如果你现在回答不了这四个问题,我的建议是:先把想法收缩到一个岗位、一个任务、一批真实样本,把数据、流程、责任和验收跑通,再来重新评估。
FDE这个角色的要求,不只是懂模型、知识库、工作流和Agent。更要进入业务现场,把老板的一句话需求拆开,找到真正值得做的任务;和业务专家定规则,跟技术人员确认接口和边界,再找到愿意试用、愿意确认结果的人。
FDE做的,常常就是这些不太好展示的工作。
而项目最后能不能用、钱能不能收回来,偏偏由这些工作决定。
最后,我把这四问扩充成了一张《FDE场景准入四问检查表》,每条下面都会带具体的追问示例。
建议先收藏这篇文章,对照你手上的项目一条条过。需要检查表原件的,后台留言:准入四问
我是申悦,企业AI顾问,解决方案型FDE。提供企业AI培训、AI落地方案咨询、AI智能体设计和运营陪跑服务。服务过东风集团、海亮集团等世界500强企业。如果你的公司正在AI转型、知识库建设和智能体落地,点击文末左下“阅读原文”查看合作方式,加V详聊:s2dongman
热门跟贴