OpenAI研究员Roon在社交平台上更新了自己对AI灭绝人类概率的估计,从不到1%上调至超过10%。这条推文发布于2026年9月9日凌晨5点16分,显示浏览量为1.4K

他给出的时间范围是未来十年内。原话是:“我个人认为在未来十年内这个概率超过10%。”

打开网易新闻 查看精彩图片

从不到1%到超过10%

Roon此前对AI灭绝风险的概率估计不到1%。这次上调后,他在推文中提到了对Anthropic的看法。

他写道:“Jacob说得对——我们真的发自内心相信AI可能杀死所有人类。”随后他表示:“我相信Anthropic在尽力,但针对超级智能的对齐方案,我们目前还没有计划,也看不出已经走在正确的轨道上。”

对齐问题

所谓“对齐”,指的是让超级智能系统的目标与人类利益保持一致。Roon在推文中没有进一步解释对齐问题的具体细节,也没有说明OpenAI内部是否有相关方案。

他肯定了Anthropic“在尽力”,但同时表示目前没有解决超级智能对齐问题的计划,也没有走在正确轨道上。

为什么这个表态值得关注

Roon的身份是OpenAI研究员,而Anthropic是AI安全领域的主要公司之一。一个OpenAI研究员公开表示Anthropic在尽力但还没有对齐超级智能的计划,同时把自己对灭绝风险的估计从不到1%上调到超过10%,这个组合本身带有信号意义。

在AI安全讨论中,p(doom)这个指标——即“AI导致人类灭绝的概率”——一直是个敏感话题。Roon这次给出的数字属于严肃的风险估计。

十年窗口

Roon把时间框定在“未来十年内”,而不是更长的时间范围。他在推文中没有进一步解释为什么选择这个时间窗口,也没有说明超级智能何时可能到来。

他只是在推文中摆出了一个判断:未来十年内AI导致人类灭绝的概率超过10%