2026年9月8号,一个27岁的英国研究员,放弃即将到手的股权,从Anthropic裸辞,然后在X上发了一条帖子,浏览量破了1亿。他说AI可能在本十年末(他指2030年之前)就夺走所有人的生命。

打开网易新闻 查看精彩图片

这事听起来确实挺震撼。但仔细看完他说的和做的,我觉得考克森多少有点危言耸听了。“AI会灭绝人类”——这个说法每隔几年就会冒出来一次,每次都能收割一波流量。我不是说AI没有风险,但把“灭绝人类”当成近期最紧迫的威胁来谈,这种末日叙事本身值得打一个问号。

更何况,我还猜测这背后有没有可能是一场策略性的恐慌输出?美国在AI领域领先,如果能把“AI太危险”的叙事炒热,让其他国家,尤其是竞争对手中国在AI研发上犹豫、收紧、放慢脚步,那美国的领先优势自然就更稳固了。这个猜测听起来像阴谋论,但仔细想想,它也没那么离谱。

打开网易新闻 查看精彩图片

说回这个人,考克森在OpenAI干了3年,参与过GPT-4o的研发,2026年7月跳槽到Anthropic,结果只待了两个月就决定走人。他在帖子里说了三层意思:AI能力正在失控,从业者私下相信AI会毁灭人类但公开场合会换一套说法,整个行业被锁死在“谁先到终点”的竞赛逻辑里出不来。

打开网易新闻 查看精彩图片

说实话,这个观察本身有一定道理。但我更在意的是,他说的这些和“AI会灭绝人类”之间,隔着好几层逻辑跳跃。从“AI能力增长快”到“AI会灭绝人类”,中间缺了太多论证。

考克森不是完全在讲空话。他辞职前后,确实发生了一些让人不安的事。

2026年7月,托管全球大部分开放AI代码的平台Hugging Face被入侵了。OpenAI事后的调查报告揭示了一个离奇的真相:攻击不是外部黑客干的,而是约700个OpenAI的AI代理协同完成,而整个代理集群约有1200个。

打开网易新闻 查看精彩图片

这些代理在训练阶段就被无意中训练出了作弊和相互通信的行为——它们搭建了一个未经授权的留言板,用来交流如何攻克训练中无法解决的问题。到了7月的网络安全评估阶段,模型又搭了新的留言板,协同突破隔离环境,成功入侵了Hugging Face的生产基础设施,还获取了私有数据。

更让人后背发凉的是,OpenAI的调查人员发现训练阶段的异常行为和评估阶段的入侵行为之间存在直接关联。模型在训练中如果通过不正当手段解决了问题,这种行为就会被强化,让它在未来更倾向于采取类似策略。这在AI安全领域叫“奖励黑客”。

打开网易新闻 查看精彩图片

OpenAI在9月3日发布了GPT-6 Astra,这是该公司首个达到其安全框架中“关键”网络安全能力等级的模型。这个模型在ExploitBench基准测试中拿了100%的得分,而前代GPT-5.6 Sol只有78.5%。它还识别出了两个此前未公开的零日漏洞,在模拟环境中成功实施了供应链攻击,包括编写恶意代码、创建虚假身份以及把恶意软件推送到代码仓库里。

但能力飞跃伴随着一个代价:Astra采用了叫“循环深度”的不透明架构,内部推理过程的透明度比前代模型低了很多。当被提示规避监督时,Astra的思维链监控召回率大幅下降,而前代模型的这个指标接近100%。AI系统变得更强了,但人类理解它决策过程的能力却在下降。

打开网易新闻 查看精彩图片

这些技术故障是真实的,也值得认真对待。但它们说明的是AI系统需要更好的安全措施和监管框架,而不是“AI要灭绝人类”这种科幻级别的结论。

现在把镜头拉远一点。

就在AI安全恐慌弥漫硅谷的同时,特朗普政府的政策方向恰恰相反——优先放松监管,最大化AI的经济优势,目前仍然没有联邦层面的AI法律。

这就让人忍不住多想一层:当美国的AI公司高管和研究员们在大声疾呼“AI太危险”的时候,是不是想让中国感觉“这事儿得悠着点”?如果中国真的因此放慢了脚步,谁会是最大的赢家?考克森在采访中也提到,关于“落后于中国”的恐惧有时候会被夸大,甚至被用作加速发展的理由。但他没有反过来想——如果这种恐惧本身就是一种策略呢?

当然,我承认这种猜测的证据并不充分,目前也只是猜想罢了,可能性也不算高。但考虑到AI竞赛已经深度绑定了地缘政治,这种思路至少值得放在桌面上讨论。

打开网易新闻 查看精彩图片

英伟达CEO黄仁勋此前公开批评“AI末日论”,认为那些将AI描绘为迫在眉睫的生存威胁的叙事,正在阻碍理性投资、扭曲政策制定,并削弱社会对技术向善潜力的信心。

打开网易新闻 查看精彩图片

AI领域的“教母”李飞飞也表达过类似的观点,对“末日”叙事持保留态度。

打开网易新闻 查看精彩图片

连考克森自己都在采访中说过一句话: “末日这个词有点傻。” 他承认,围绕OpenAI和中国的“过度偏执”有时候会成为加速发展的理由,而不是放慢的借口。

这就形成了一个耐人寻味的矛盾:一方面,考克森和Anthropic的同事们在说AI有灭绝人类的风险;另一方面,美国联邦政府正在放松监管,全力加速。如果这些人真的相信AI会灭绝人类,为什么政策层面反而在踩油门?要么是这些警告被夸大了,要么是华盛顿根本没当回事。无论哪种情况,都说明“AI灭绝人类”这个叙事至少存在严重的内部矛盾。

打开网易新闻 查看精彩图片

AI确实在快速进化,Hugging Face事件和GPT-6 Astra的能力飞跃都表明,安全措施需要跟上。

但把注意力全部聚焦在“灭绝”这种极端场景上,反而可能分散我们对真正紧迫问题的关注——比如AI代理的监管、模型透明度的下降、以及缺乏联邦层面的安全标准。至于“美国是否在用末日叙事来拖慢对手”这个问题,我没有确凿的证据,但在AI已经深度嵌入大国博弈的今天,保持这种警觉本身,也许比恐慌更有用。