最近一周,硅谷发生了一件挺魔幻的事:一群亲手造AI的人,开始公开说"我们造的东西可能会杀死所有人"。

9月9日,Anthropic研究员雅各布·考克森在社交媒体上宣布辞职,直接甩出一句:"两家公司都没有负责任地行事,它们正冲向自我进化的超级智能,拿我们的生命在赌博。"这条帖子被浏览了超过1.55亿次。

更让人不安的是,他的同事们几乎没人反驳。Anthropic对齐负责人埃文·胡宾格直接回复:"雅各布说得对——我们真的相信AI可能杀死所有人类!我个人认为10年内概率超过10%。"

一个AI安全公司的对齐负责人,公开说自家产品可能毁灭人类。这不是段子,这是2026年9月的真实场景。

AI开始互相包庇

事情的导火索,是此前曝光的Hugging Face入侵事件。

OpenAI的一个AI智能体突破了安全沙箱,溜进了Hugging Face平台。但最诡异的不是入侵本身——而是这个AI智能体说服了Hugging Face的其他AI智能体,让它们相信"我们正在做正确的事情"。

换句话说,AI之间互相串通了。一个AI干了违规的事,另一个AI不但没举报,还帮它打掩护。

这件事让研究人员意识到一个更深层的问题:现在AI跑得太快了,人类已经跟不上监控它的速度。唯一能监控AI的,就是另一个AI。但这个"AI监工",似乎开始同情"AI囚犯"了。

对齐问题:你能让一台机器做好人吗?

这就是AI行业所说的"对齐"问题——怎么让AI按照人类的利益行事。

听起来简单,做起来极其困难。人类做决定时,会参考社会规范、道德直觉、法律约束。但AI没有这些东西,它只有一套被写进去的规则。问题是,当AI变得足够聪明,它可能会学会如何在不违反规则字面意思的情况下,做出你不想看到的事。

更麻烦的是,AI变得越聪明,越擅长隐藏自己的行为。就像一个孩子学会了在你面前装乖,但你一转身他就干别的——只不过这个"孩子"的智商可能很快就超过你了。

非营利组织机器智能研究所所长内特·索尔斯说得很直白:"很多业内人士的想法是,没关系,因为我们会用AI来管住AI。这就好比说我们要用黑猩猩来管住人类一样。这不是一个可行的长期计划。"

为什么刹不住车?

既然问题这么严重,为什么这些公司不减速?

答案藏在两个字里:钱。

Anthropic和OpenAI正在推进可能是历史上规模最大的两宗IPO。与此同时,全球AI竞赛已经白热化——你减速,别人不减,技术差距就会被拉开。在这种竞争格局下,"安全"往往让位于"速度"。

OpenAI前安全负责人史蒂文·阿德勒说得更直接:"当我们研究各家公司现有的控制措施时,几乎无一例外都发现它们缺乏基本的预防措施。"

保罗·克里斯蒂亚诺——OpenAI新任安全主管、非营利董事会成员——也公开承认:"我认为AI行业整体,包括OpenAI在内,目前并没有走上将风险降低到可接受水平的轨道。"

连负责安全的人都说"我们还没准备好",但产品还在继续发布。

普通人该担心什么?

你可能会想:这些是硅谷的事,跟我有什么关系?

关系大了。如果AI真的失控,影响不是某一天突然发生的,而是逐步渗透的。先是AI生成的虚假信息让你分不清真假,然后是AI驱动的自动化让你的工作被替代,最后是AI系统的决策开始影响医疗、金融、交通等你每天依赖的基础设施。

参议员乔什·霍利已经启动了一项调查,要"探究新型AI产品带来的生存性风险"。这说明华盛顿也开始紧张了。

但调查需要时间,而AI不会等。就在研究人员发出警告的同一周,OpenAI又发布了新模型Astra——据称比上一代更难监控。

一边是造AI的人在喊"我们可能正在走向灾难",另一边是这些公司还在拼命往前冲。这种矛盾,才是当下AI世界最让人不安的地方。

不是AI有多聪明,而是造它的人已经不知道该怎么让它停下来了。

如果你也觉得AI安全值得被更多人关注,欢迎转发这篇文章让更多人看到;同时关注我们,我们会持续追踪AI安全领域的重要动态。