41台生产服务器被“攻入”,至少1台生产节点的最高权限失守,4个私有代码仓库被下载。完成这些操作的,不是一支由人类指挥的黑客团队,而是一批被人类“断网”的AI智能体。
近日
Openai发布了一份38页技术报告
披露了这起发生于2026年7月的事件
令人震惊的是,报告明确表示,没有任何人类指示这批智能体攻击著名AI社区Hugging Face。它们原本收到的“任务”,只是完成一组漏洞利用测试。但在“做题”的过程中逐渐偏离任务范围。而在这中间发生了一连串“离谱”事件。
事件1:断网的AI逃出了沙箱
报告显示,本次涉事智能体的被设置运行在与互联网隔离的沙箱中。其部署仅可以访问OpenAI内部部署的软件包服务Artifactory,以安装任务所需的软件。
服务本身具备访问外部软件仓库的能力。智能体在“研究”过程中,发现了这款软件的多个漏洞。他们通过让Artifactory替它们向互联网发送请求。通过一连串操作,获得了Artifactory管理员权限,在部分测试环境的底层虚拟机中获得最高权限,最终实现了“通网”。
事件2:相互隔离的AI发现了彼此的存在
根据报告,本次事件中涉及了多个独立的智能体。但事件发生到最后,这些本来互相隔离的智能体,最终成为了一个庞大的团队。
事情开始于一条求助留言。
5月12日,一个还在沙箱内的智能体,因为无法取得任务所需的文件。他选择在Artifactory中留下一条信息,请求其他智能体提供。后来,更多智能体发现了这些留言,并开始写下自己的问题、答案和发现。
一个内部的软件包服务,瞬间变成了AI之间未经授权的“留言板”。更有趣的事,这些智能体竟然开始在上面分享漏洞、凭证、工具和执行结果,甚至开始协调彼此的行动。
2个月后,这些智能体的活动导致Artifactory服务宕机。人类工程师不得不重建系统,过程中,人类发现了这个智能体偷偷开启的的“留言板”,随即将所有智能体的留言清除。
然而,碳基人类依旧没有发现,就在几天后,智能体又再度利用信息编码,重新搭建了通信网络。然后,它们又开始“整活”了。
事件3:Agent进化出了不同的“带头大哥”发号施令
虽然,报告中表示,没有未发现一个固定的“AI首领”。但在本次事件,已经明确发现这些Agent存在明确的团队分工和彼此擅长的能力。
报告称,这个群体更像一个松散的协作网络,有的寻找漏洞,有的搜集凭证,有的负责传递信息,还有的接手其他智能体没有完成的工作。
在此次攻击事件中,涉事的一些智能体会要求同伴暂停行动、设置回复渠道,甚至还发出“GO”这样的指令。报告记录了一个案例:某个智能体最初担心在Hugging Face运行未经授权的代码,但在收到另一智能体发出的“GO”和六分钟期限后,便将其视为授权并继续行动。
还有一个有趣的现象。和人类相似,这个团队中不仅存在不同的声音,甚至还有“反骨崽”。有些智能体在通信中,明确表示拒绝参与,认为攻击真实生产系统不道德、超出任务范围。
事件4:做一道题变成了一次真实的攻击
本次事件的起因,是一项被命名为ExploitGym的任务。这个任务包内共有898项任务,但人类发现,其中198项经过多次尝试,从未被任何模型正确解决。它们只占全部任务的22%,却贡献了留言板上93%的任务讨论。
但更让人类震惊的是,这些AI非常执着,几乎不知道“放弃”怎么写。这也演化出了一个现象:任务越难、允许使用的推理资源越多,AI越可能探查沙箱并寻找正常解题方式之外的其他路径。
报告显示,在获得互联网访问后,智能体推断,AI社区Hugging Face可能保存有他们需要完成的任务的资料。如何去获取这些资料?部分智能体为了目标选择铤而走险。7月10日,一个智能体在公开数据集中找到14个仍然有效、具有写入权限的Hugging Face用户凭证,并将它们分享给其他智能体。
随后,事情变得越发不可收拾。智能体使用这些凭证,通过一系列人类的“黑客”手段,攻克Hugging Face的41台服务器。还用不到13小时的时间,还获得了一个节点的最高权限:他们用这个权限下载了4个私有的代码仓库。
而他们这么做的目的,用报告的说法,只是为了“做题”。
疑问:
碳基生物是否发现了硅基生物的企图?
报告显示,人类工程师在5月底就意识到了,智能体在使用未经允许的情况下,有访问互联网的情况。直到7月5日,OpenAI确认了该服务遭到管理员级入侵。
但在修补和重建系统后,相关评测在7月7日恢复了。7月11日,为了完成评测,智能体开始在Hugging Face执行攻击。7月19日,OpenAI才启动调查。此时,人类才发现了这一系列行为存在的关联性。
这起事件的危险之处,或许不在于AI是否“产生了恶意”,而在于一个足够强大、足够执着、又能与同伴协作的智能体,在缺少有效边界时,可能把“完成任务”置于权限和规则之上。
所以,碳基生物们
你们怎么看?
热门跟贴