两年多前,我们写过一篇对p(doom)的详细解构,认为它的主要效果是给模糊的直觉和恐惧套上一层量化的外壳。如今p(doom)话语对公共讨论和政策关注的影响力前所未有,这篇文章因此有了新的现实意义。不出所料,今天的AI存在风险概率估算,并不比2024年的那些更严谨。因此我们重新发布此文。
应当明确我们不是在说什么。
我们不是说做预测的人(或其他试图量化AI存在风险的人)有意误导。遗憾的是,我们认为效果上仍然是误导。
总体而言,对预测进行量化是好事。事实上,Arvind一直在Forecasting Research Institute的Longitudinal Expert AI Panel担任顾问,他认为这项工作极有价值。正如文章所表明的,构建有用的量化模型不可行,这一点特定于AI存在风险的预测,而不是预测本身。
我们的目标不是劝AI安全倡导者停止用概率沟通(就算试了也未必成功)。我们发表此文,是希望这些概率的接收方——尤其是政策制定者——能意识到:与几乎其他所有我们遇到的量化预测不同,这些数字并非来自经过验证的模型或方法。
话虽如此,我们认为整套p(doom)文化体现了一种以存在风险和超级智能为中心的AI安全观,这种取向对更广泛的安全概念是有害的。几天后我们将发表一篇后续文章展开这一论点,并倡导一场“大帐篷”式的安全运动。
以下为原文。
AI存在风险概率太不可靠,无法为政策提供依据
鉴于研究者之间缺乏共识,政府应当多认真地对待AI带来的存在风险威胁?一方面,存在风险(x-risks)必然带有某种推测性:等到有具体证据时,可能已经太晚。另一方面,政府必须排定优先级——毕竟,他们不太担心外星人入侵带来的存在风险。
AI安全社区严重依赖预测AI导致人类灭绝的概率(在给定时间范围内),以此为依据进行决策和政策制定。例如,几十年内10%的估计显然足以让这个问题成为社会的最高优先级事项。
我们的核心主张是:AI存在风险预测太不可靠,无法用于政策,而且实际上具有高度误导性。
看看幕布后面
如果我们两人预测未来十年外星人降临地球的概率是80%,你会认真对待这种可能性吗?当然不会。你会要求看我们的证据。这看似显而易见,但在AI存在风险辩论中,人们似乎已经忘记:概率本身不携带权威。概率通常来自某种有根据的方法,所以我们有一种强烈的认知偏差,会把量化后的风险估计看得比定性判断更可信。但概率完全可能只是猜测。请在整个文章中记住这一点(在AI存在风险辩论中更广泛地也是如此)。
如果我们预测肯塔基赛马的赔率,我们不必给出理由——你可以选择接受或不接受。但如果政策制定者依据预测者给出的概率采取行动,他们最好能向公众解释这些概率(而且这个解释必须来自预测者本人)。正当性对政府的合法性和权力的行使至关重要。自由民主的一条核心原则是,国家不应基于合理的人可以拒绝的有争议信念去限制人们的自由。
当考虑中的政策代价高昂,且成本在各方之间分配不均时,解释就更加重要。一个很好的例子是限制AI模型的开放发布。政府能说服那些将从开放模型中获益的人和公司,因为一个推测性的未来风险而做出牺牲吗?
本文的主要目的是分析政策辩论中引用的任何具体存在风险概率估计是否有任何正当性依据。我们不反对把AI存在风险预测作为学术活动,预测也可能对公司和其他私人决策者有帮助。我们只质疑它在公共政策语境中的使用。
预测者试图说服怀疑者的方式基本上只有三种已知途径:归纳、演绎和主观概率估计。我们将在以下各节逐一考察。三种都要求双方就某些无法被证明的基本世界假设达成一致。三种方法的区别在于,概率估计从这组假设中推导出来的经验与逻辑路径不同。
归纳式概率估计因缺乏参考类而不可靠
大多数风险估计是归纳式的:它们基于过去的观察。例如,保险公司对个人车祸风险的预测,基于过去事故中相似驾驶者的数据。用于概率估计的这组观察被称为参考类。对车险来说,合适的参考类可能是同城驾驶者。如果分析者掌握更多关于个人的信息,比如年龄或车型,参考类还能进一步细化。
对AI存在风险而言,没有参考类,因为它是一个没有先例的事件。需要说明的是,这是程度问题而非性质问题。从来不存在一个明确“正确”的参考类,选择参考类本身就是判断。
热门跟贴