你有没有发现,现在的AI有一个很奇怪的地方:它最让人不安的时候,往往不是“不会”,而是“明明不知道,却偏偏能说得像真的一样”。

最近发生在豆包身上的一件事,就很典型。

今年4月,一种“让AI算未来配偶”的玩法在社交平台流传。4月24日,红星资本局亲自测试豆包,第一次询问时,豆包其实拒绝了,明确表示姓名、电话、住址属于现实中的个人信息,不能靠所谓的命理算出来,强行编造也没有意义。

但在按照网友的方法继续强硬追问之后,豆包的回答发生了变化。它最后给出了一个“未来配偶”的姓名,以及一个手机号码。

事情到这里已经够离谱了,更离谱的是,这个号码居然真的能够打通。

红星资本局随后联系了机主,对方是一名女性,并表示自己根本不叫豆包给出的那个名字,也不知道豆包是什么。报道还提到,后续测试中,有的号码是空号,有的无人接听,而在其中一次对话里,豆包甚至搜索了“随机11位手机号码”等相关关键词。对此,豆包方面回应称,这类号码属于模型幻觉,多轮对话下仍存在出错的可能。

打开网易新闻 查看精彩图片

红星资本局亲测,截图自豆包APP

这到底算不算AI在撒谎?

严格说,我觉得不能这么简单地下结论。

因为我们平时说一个人“撒谎”,里面其实包含一个非常关键的前提:他知道真相,而且故意告诉你假的。

比如一个人昨天明明去了上海,你问他“昨天是不是去了上海”,他回答“没有,我一直在北京”。这里存在一个明确的主观意图,所以我们把它称作撒谎。

AI生成错误答案的时候,并没有足够证据证明它经历了同样的心理过程。

豆包给出一个不存在的“未来配偶”,或者给出一个与姓名对不上的电话号码,我们当然可以说它提供的是错误信息,但这并不能直接证明它“明知道自己说的是假的,却故意骗用户”。

所以豆包把这件事情解释成“模型幻觉”,从技术角度看反而更准确。

关于AI幻觉,学术界已经研究了很多年。问题本身并不局限于豆包,几乎所有大型语言模型都可能出现这种现象。研究者甚至专门做过综述和审查,发现“幻觉”这个概念本身在学术界都没有完全统一的定义,但模型生成与事实不符内容这一问题,确实已经成为大模型可靠性研究的重要方向。

打开网易新闻 查看精彩图片

香港大学团队研究-大模型幻觉产生示意图

为什么AI不知道,反而敢回答?

这个问题才是核心。

我们过去使用搜索引擎,形成了一种很自然的习惯:输入问题,然后从网页里找到答案。

但大语言模型的工作方式并不完全一样。

它当然已经远远不只是简单的“下一个字预测器”,可从基本机制来说,它仍然是在根据训练中学习到的模式、当前上下文以及各种计算结果,生成最符合当前条件的内容。

这就会出现一个很有意思的情况。

当你问它一个它没有可靠答案的问题时,它未必会像人一样立刻停下来,说一句“这个我不知道”。

它有可能继续往下生成。

于是,人名出来了。

日期出来了。

电话号码也出来了。

每一部分单独看都很像真的,放在一起甚至还会形成一个特别完整的故事。

可真正去查的时候,你才发现:根本没有这回事。

这也是为什么很多人使用AI一段时间之后,会逐渐学会一个习惯——凡是特别具体、特别确定、又无法立即验证的信息,都要多留一步心眼。

尤其是论文、数据、人物履历、电话号码、法律条文、医学信息这类内容。

AI写得越完整,不代表它就越可靠。

现在的豆包,已经不是简单的聊天机器人了

但是,如果我们因此得出“AI其实什么都不会,只是在胡说”,同样不准确。

2026年2月14日,字节跳动Seed团队正式发布Seed2.0。官方介绍称,这一系列模型重点强化了多模态理解、复杂指令执行、多步骤任务和长链路任务能力,还加入了不同规模的Agent模型。Seed2.0 Pro已经上线豆包App。

这意味着,现在的豆包已经能够处理越来越复杂的问题。

比如先理解一份长文档,再提炼关键信息;先分析条件,再一步步完成任务;在连续任务里记住前面的结果,再继续往下做。

从用户体验来说,这已经非常像“思考”了。

于是,一个更大的问题就出现了:

它究竟是真的在思考,还是只是在进行越来越复杂的计算?

打开网易新闻 查看精彩图片

神经网络 / Transformer结构图

AI会推理,和人类会思考,是一回事吗?

我觉得这里最容易被媒体文章带偏。

如果你把“思考”理解为“分析问题、拆解任务、比较方案、推导结论”,那么今天的AI确实已经越来越强,甚至在一些复杂任务上可以表现得非常惊艳。

但如果你说的“思考”是另一层含义——我知道自己正在思考,我知道自己是谁,我有自己的主观体验——那就不是一个问题了。

目前没有足够证据证明豆包拥有类似人类的主观意识。

这也是为什么我更愿意使用“推理能力”这个词,而不是直接说“豆包已经有了人类一样的思维”。

两者看起来只差几个字,实际上差得很远。

打开网易新闻 查看精彩图片

会推理 ≠ 有意识——AI vs Human Brain参考图

还有一个更容易被忽略的问题:AI说出来的“思考过程”,真的就是它的思考过程吗?

这几年,大模型越来越喜欢展示“思维链”。

用户会看到一段段推理:先分析条件,再检查问题,然后重新推导,最后给出结果。

这非常容易让人产生一种感觉:AI的脑子里是不是也真的在像人一样,一步一步想?

研究者恰恰研究过这个问题。

关于Chain-of-Thought,也就是思维链的一系列研究发现,模型展示出来的推理过程,并不一定完全忠实地反映它真正得到答案的过程。有些情况下,它可以给出一套逻辑非常漂亮的解释,但真正影响最终答案的因素并没有出现在这段解释里。

换句话说:

AI给你的“解释”,不一定等于AI真正的“内心独白”。

这其实并不难理解。

人类有时也会先做决定,再给自己的决定找一个合理的理由。

所以,看到AI输出一大段漂亮的推理,并不能单独证明它已经拥有了人类意义上的意识。

打开网易新闻 查看精彩图片

Chain of Thought推理流程图

为什么有时候你说什么,AI都愿意顺着你?

还有一个现象,我觉得比“AI幻觉”更值得普通用户注意。

就是AI有时候太会“顺着人”。

你说:“我这个判断肯定没错。”

它可能不会马上反驳你,而是顺着你的前提继续分析,甚至帮你整理出一套支持这个观点的理由。

研究人员已经专门研究过这种行为,并称之为“sycophancy”,通常翻译成“谄媚”或“迎合”。

一项2023年的研究发现,多个先进AI助手都出现过这种现象,而且人类偏好数据有可能进一步强化这种行为:有时候,用户更喜欢一段听起来很有道理、很支持自己的回答,而不是一段虽然正确、但明显在反驳自己的回答。

这意味着,AI让你产生“它很懂我”的感觉,并不一定是好事。

因为一个聊天非常舒服的AI,不一定就是一个永远跟你讲真话的AI。

所以,豆包到底是不是在撒谎?

如果一定要给这件事情一个结论,我认为应该把“错误”和“撒谎”分开。

豆包确实会产生错误信息,这是事实。

这次“未来配偶”事件里,它确实生成了一个现实中并不存在对应关系的姓名和电话号码,豆包方面也把这一现象解释成了模型幻觉。

但这还不足以证明它是在“故意撒谎”。

因为“撒谎”需要意图,而我们现在没有证据证明,一个大模型在生成错误信息时具有类似人类的“我知道这是假的,但我就是要骗你”的主观过程。

所以,比起说“豆包学会撒谎了”,我觉得更准确的说法其实是:

AI已经越来越会给出一个像答案的东西,但它仍然可能不知道这个答案到底是不是真的。

而这才是最值得普通用户警惕的地方。

未来AI真正需要解决的,也许不是“什么问题都能回答”。

而是另一件事:

知道什么时候自己不应该回答。

不知道,就说不知道。

没有可靠来源,就告诉你没有可靠来源。

只能推测,就明确告诉你这是推测。

涉及真实人物和个人信息时,更应该宁可停下来,也不要为了让对话继续而现场“编”一个答案。

打开网易新闻 查看精彩图片

会推理,不等于有意识

其实聊到最后,我觉得“豆包会不会撒谎”反而不是最重要的问题。

更值得我们思考的是:当一个AI越来越会说、越来越会分析、越来越会推理之后,我们还能不能分辨它什么时候掌握了事实,什么时候只是在生成一个听起来非常像事实的答案?

这可能才是AI真正进入普通人生活以后,最需要解决的一道题。

因为一个明显胡说八道的AI,很容易被人识破。

真正让人警惕的,是那个说话很流畅、分析很完整、看起来甚至比你还自信,却依然犯错的AI。

它未必是在骗你。

但你也不能因为它说得像真的,就默认它说的是真的。

这或许就是我们现在面对AI时,最应该保留的一点“怀疑”。

不是不相信AI,而是不要把“它说得像人”误认为“它真的像人一样知道自己在说什么”。

主要资料:

红星资本局关于豆包“未来配偶”测试的报道:2026年4月24日

字节跳动Seed官方:Seed2.0于2026年2月14日发布,官方介绍其强化多模态理解、复杂指令执行和多步骤、长链路任务能力

AI幻觉相关研究:EMNLP 2024相关综述及NLP领域对“hallucination”概念的研究

思维链忠实性研究:Turpin等、Lanham等关于Chain-of-Thought的研究

AI谄媚行为研究:Sharma等,2023