一位经理给AI发了条消息:“这个区域按我们的收费标准,送货费是多少?”几秒后,屏幕上跳出一段自信满满、语气专业的回复。他觉得没问题,直接复制进了给客户的邮件。第二天,他发现报价单里的一个数字是错的——而AI从头到尾没有给出过任何不确定的信号,连个“可能”的字眼都没有。
这种体验并非个例。许多人在工作中遇到过类似情况:AI的回答读起来头头是道,可一旦深究,事实却经不起推敲。更令人不安的是,即便你同时询问多个AI模型,得到一堆同样流利的答案,错误的可能性依然存在。因为它们犯错的逻辑,根植在技术底层。
要理解这一点,得先弄清楚AI到底是怎么给出答案的。它不像你想象的那样,会打开一个内置的“事实数据库”去核对。OpenAI的API文档直接点明了:开发者通过“提示词”来编程模型的行为,而模型的输出被明确定义为“非确定性”的——同样的输入,在不同的调用中可能产生不同的结果。这意味着,模型的回答不是从某个标准答案库中检索出来的,而是根据它学到的语言模式和当前提供的上下文,逐词地“续写”出最有可能的下文。
用更直白的话说,当你提问时,模型做的事就是:“基于我看到的文本,下一个词最可能是什么?”然后再基于新生成的词,继续猜下一个词。这个过程并不包含事实核查环节。这就导致了一个关键后果:如果在喂给模型的上下文中,你忘了放进某条关键信息——比如最新的收费标准——那么对于模型来说,这条信息根本就不存在。它不会告诉你“我缺少数据”,而是会用剩下的信息填补出一个听起来合理的数字,并且用同样肯定的语气告诉你。
更隐蔽的问题在于,即使你把所有必要信息都塞进了上下文窗口,也不代表模型一定会用到它们。2023年一项发表在顶级计算语言学期刊上的研究,指出了“迷失在中间”的现象:当模型处理长文本时,它对开头和结尾的信息抓取得最好,而对于处在中间位置的关键事实,准确率会明显下降,形成一条U形曲线。也就是说,你小心翼翼放进提示中间的那几行收费表,或那段法规原文,恰恰最容易被模型“看漏”。
这就能解释为什么一个简单的查询,AI会给出一个看似完美却包含致命错误的答案:不是它故意撒谎,而是它在续写时,既可能漏掉了你没给的数据,也可能根本没注意到你给过的数据。而无论哪种情况,它的语调都不会发生任何变化——因为它不会,也没有被设计成在不确定时举起手说:“等等,我需要核实一下。”
即使你使用那种能同时调用多个模型的聚合工具,也别被一连串流利的回复迷惑。多个模型犯同样错误的概率也许更低,但它们各自犯错的方式却可能相似,因为它们都建立在类似的概率续写机制上。最终,核实的责任仍然落在人身上。在下一次把AI的回答粘贴进重要文件前,最好停下来,想一想那句话背后到底有没有事实的锚点。
热门跟贴