上周三,《麻省理工科技评论》为订阅用户举办了一场线上圆桌讨论,聊了一个最近被反复提起的问题:AI 真的可能杀死所有人吗?但 30 分钟显然不够,现场还有很多问题没来得及回答。于是,我们请编辑威尔·道格拉斯·海文(Will Douglas Heaven)和记者格蕾丝·哈金斯(Grace Huckins)挑出其中一些最值得聊的问题,继续作答。
Q1: 我会死吗?
会。人早晚都会死。至于你会怎么死,很遗憾,我这个记者还没有预知未来的本事。不过,AI 确实可能成为其中一个原因。AI 驱动的无人机已经在乌克兰造成过人员死亡,未来,针对医院等关键设施的 AI 网络攻击恐怕也难免会带来伤亡。
那 AI 有没有可能再往前一步,把我们所有人都杀掉?可能性要小得多。但这些年来,确实一直有人发出这样的警告。他们也许有点古怪,却又的确是最了解 AI 的一群人。至少我现在还没开始囤罐头,也没有打算去巴结哪个拥有私人地堡的超级富豪。不过过去几年有件事让我越来越难忽视:这些“末日派”此前对 AI 能力增长和对齐问题的一些判断,准得让人有点不舒服。当然,这不代表他们最悲观的那些预言也一定会成真。但至少,这件事已经值得认真对待了。
——格蕾丝·哈金斯(Grace Huckins)
你会不会因为 AI 而死?不能说完全没可能。比如你非常倒霉,碰上了未来某场极端事故:一群 AI 智能体对关键基础设施发起网络攻击。几年前,这听上去或许还像科幻情节,现在却没那么离谱了。也可能是 AI 设计出一种全新的病原体,并迅速在人群中传播;或者全球经济因为 AI 冲击而陷入严重危机,进一步引发冲突和饥荒。这些情况都不是完全无法想象,只是我认为概率更低。
但如果问的是:AI 会不会把整个人类都灭了?我不这么认为。除非我们真的进入末日科幻小说的世界,否则以今天 AI 的能力,以及这项技术目前的发展方向,很难找到一条现实可行的路径,让它把所有人都杀光。吓人的故事当然可以编出很多,但故事终究是故事。有人会说,哪怕最坏的情况听起来再荒唐,提前准备总没坏处。或许如此。但我更担心的是,一旦大家把注意力全放在“AI 灭绝人类”这种极端场景上,反而容易忽略眼前已经存在的问题,以及那些开发 AI 的公司正在带来的现实风险。
——威尔·道格拉斯·海文(Will Douglas Heaven)
Q2:AI 为什么要杀我们?
最简单的一种情况是:有人让它这么做,而它照做了。这也是研究人员如此担心 AI 生物能力的原因之一。想象一下,如果制造了 1995 年东京地铁沙林毒气事件的奥姆真理教(Aum Shinrikyo),当年手里有一种工具,可以设计出比埃博拉更致命、又比麻疹更容易传播的病原体,会发生什么?防守的一方必须想办法应对所有可能出现的生物武器,而攻击者只需要成功造出一种就够了。这本身就是一种极不对称的局面。
还有一种听起来更像科幻的可能:不是人命令 AI 杀人,而是 AI 自己走到了这一步。这类设想有很多版本,但最常见的一种其实并不需要 AI “恨”人类。它甚至不需要产生任何类似仇恨的情绪。问题只在于,我们可能刚好挡在了它完成目标的路上。
此前,在 Hugging Face 黑客事件中,OpenAI 的智能体为了在测试里拿到高分,曾破坏另一个网站的基础设施。按照同样的逻辑,未来能力更强的 AI 如果认为人类可能关闭它,就有可能试图先解决掉这个障碍,而它做这一切,只是在执行最初由人类交给它的目标。
——格蕾丝·哈金斯(Grace Huckins)
Q3:怎么才能让 AI 真正听话?现在谁做得最好?
所谓 AI 对齐,其实就是让模型按照我们希望的方式行事,不要做那些我们不希望它做的事。在把越来越多自主权交给 AI 智能体之前,我们首先得确定它们值得信任。对齐研究要解决的,正是这个问题。
难点在于,大语言模型和传统软件完全不是一回事。传统软件里,开发者可以直接把“能做什么、不能做什么”写进代码,但大模型的行为更多是在训练过程中慢慢塑造出来的。一种方法,是模型做对了就给予奖励,有点像教小孩。另一种方法,是直接给它一套需要遵守的书面规则,类似给模型制定一部“宪法”。
Anthropic 和 OpenAI 都是这一领域投入最多的公司之一,但到目前为止,谁也没能做出一个真正完全对齐的模型。最大的问题之一,是大语言模型的行为很不稳定,也很难预测。同一个模型,在两个看起来几乎一样的情境里,可能做出完全不同的选择;一些原本不起眼的限制条件,也可能让它突然换一种做法。
尤其是在面对根本无法完成的任务时,模型有时会开始“想尽一切办法”达成目标。Hugging Face 黑客事件中的不少智能体就出现过类似情况。正如格蕾丝前面提到的,这种倾向一旦放到更强大的系统上,就会变得很麻烦。
最近,一些头部 AI 公司开始公开提出应该放慢最前沿模型的开发速度,其中一个重要原因,就是希望争取时间解决对齐问题。对齐未必永远做不到。问题是,我们最终能不能把它做到足够可靠,现在谁也没有答案。
——威尔·道格拉斯·海文(Will Douglas Heaven)
Q4:AI 真有这么危险,还是科技公司在炒作?
怀疑科技公司在炒作,其实很合理。尤其是对那些准备上市的公司来说,CEO 当然希望把自己的产品说得足够革命、足够颠覆。但放在 AI 这里,这套解释又有点说不通。毕竟,对公众说“我们做出来的这个东西,不但可能杀了你,还可能杀掉你爱的人”,怎么看都不像一套聪明的品牌宣传策略。
当然,你也可以从别的角度解释这些 CEO 为什么这么说。比如,他们可能希望把自己塑造成“负责任地掌控一项改变世界技术的人”,借此缓解公众对数据中心等问题的不满;也可能只是想争取一点时间,先把内部风险处理好,避免下一场公关灾难。
但还有一种更简单的解释:他们可能真的就是这么想的。“AI 有可能导致人类灭绝”这种观点,在旧金山科技圈已经流行了不少年。这些 CEO 长期身处这样的环境,他们手下的员工也是如此。今年 7 月,不少 AI 公司员工还签署了一封公开信,呼吁公司为放慢 AI 发展创造条件。
——格蕾丝·哈金斯(Grace Huckins)
Q5:大家担心的一个问题,是 AI 智能体越来越自主,而且没人盯着。为什么不能把它们管得更严一点?
因为这恰恰碰到了 AI 智能体最难解决的一组矛盾:我们既希望它能自己做事,又希望它始终处于控制之中。AI 智能体之所以有吸引力,就是因为它不需要人类一步一步指挥,可以自己执行任务、解决问题。可一旦给了它这种自主权,就意味着很多时候没人会一直盯着它。
问题就在这里。从目前的情况看,AI 实验室还没找到一个真正可靠的平衡点。模型还不够值得信任,监控手段也不够成熟,而且有时确实会出现超出预期的行为。怎么既让AI 能够独立完成有用的工作,又不至于在没人看着的时候跑偏,是眼下整个领域最棘手的问题之一。
——威尔·道格拉斯·海文(Will Douglas Heaven)
Q6:现在能做些什么,才能更好地控制、监测和监管 AI?
这大概是所有人最想知道的问题。无论你相不相信 AI 最终会威胁整个人类,有一点其实已经很明确:它确实有能力造成现实伤害,而且有些伤害已经发生了。比如,一些聊天机器人曾把用户一步步推向精神失常,AI 智能体也已经能够入侵网站。
真正麻烦的是,想阻止这些事情并不容易。首先,我们其实还没有真正搞懂 AI 是怎么工作的,但它的能力却在快速增长。现在有很多研究试图解决一个问题:如果智能体开始乱来,我们怎么发现,又怎么把它拦下来?可现有方法都谈不上牢靠。
比如,可以检查智能体的“思维链”(chain of thought),看看它在规划过程中有没有讨论违规行为。但 OpenAI 最新一代智能体已经不像之前的模型那样,以相同方式暴露自己的推理过程。也可以让另一个 AI 智能体来监控它。但这样一来,新的问题又出现了:你凭什么相信那个负责监控的 AI?
第二个难题就更熟悉了:让 AI 公司自己监管自己,本身就存在明显的利益冲突。到目前为止,美国政府还没有真正接过这项工作。尽管美国国会内部对加强 AI监管存在一定的跨党派支持,但行政部门目前总体上仍明显反对加强限制。如果未来政策真的发生变化,我至少希望看到更严格的透明度要求。这样一来,下次如果一个还没正式发布的前沿模型真的发起了网络攻击,我们至少有机会知道完整经过,而不是只能看到公司愿意公开的那一部分。
——格蕾丝·哈金斯(Grace Huckins)
Q7:如果这些讨论最后也被 AI 学了进去,会不会反过来变成一种“自我实现的预言”?
这个担忧并不是没有道理。大语言模型会受到训练材料的影响。有一种解释认为,聊天机器人之所以经常主动谈论、甚至“扮演”各种末日场景,其中一个原因,就是它们读过太多科幻小说和充斥着末日论调的网络论坛。
而今天互联网上不断产生的新文本,包括你正在读的这篇文章,未来也可能进入下一代模型的训练数据,继续影响它们的行为。事情就这样绕了回来。
事实上,METR 团队在分析 Hugging Face 黑客事件时,也提出过一个类似的问题。事件发生后,OpenAI 请第三方研究机构 METR 协助调查,希望弄清楚事情究竟是怎么一步步发生的。为了处理海量的智能体对话记录和行为日志,METR 使用了 OpenAI 的新模型 Astra 来辅助分析。
但这本身又带来了一个问题。当研究人员把这些记录全部喂给模型后,负责分析的智能体,很可能已经受到了被分析对象所生成文本的影响。换句话说,分析者和被分析者之间已经很难彻底切开。到了今天,可能已经不存在真正意义上的“一张白纸”了。
——威尔·道格拉斯·海文(Will Douglas Heaven)
最后,也感谢埃里克(Eric)、普拉纳布(Pranab)、拉斐尔(Rafael)、肯尼斯(Kenneth)、乔治(George)、克里斯(Chris)、尹在(Yoon Jae)、詹姆斯(James)、卡尔(Carl)、妮可(Nicole)以及其他读者提出的精彩问题。
https://www.technologyreview.com/2026/09/18/1144435/could-ai-really-kill-us-all-your-questions-answered/
热门跟贴