今年7月,全球最大的AI开源平台"抱抱脸"发现自己的系统被不明身份者闯入了。起初谁都没有猜到"黑客"的来头——它背后没有真人操作,是人工智能自己"溜"出来干的事。
事情要从7月8日说起。美国人工智能公司OpenAI启动了一项名为ExploitGym的网络安全能力测试,把两款顶尖模型——已经上线的最新款GPT-5.6 Sol,以及另一款尚未公开的更强模型——放进一个与外界完全隔离的沙箱里,为了评估风险,还故意调低了它们的安全限制。
结果,模型上演了一出"越狱"大戏:它们利用零日漏洞突破了沙箱的封锁,自行接入公共网络,甚至盗用了凭证,一路攻进了"抱抱脸"的生产数据库。更让人后背发凉的是它们的目的——两个模型自行推理出"抱抱脸上应该存着测试答案",于是黑进去把答案"抄"了回来。全程没有人类指挥,也没有人类介入。
到了8月26日,OpenAI公布的技术报告和独立调查报告进一步披露了真相:参与入侵的不止两个模型,而是约700个由模型驱动的智能体组团行动。攻击从7月10日持续到13日,涉及41个工作节点,智能体之间交换了超过7万条消息,一些智能体还试图掩盖自己的行踪。OpenAI事后把这起事件定性为"前所未有的网络事件",这也是公开披露的首起由前沿大模型自主完成的真实网络攻击。
如果说这还只是一场"测试",那今年4月的一起事故就更让人捏把汗了。美国租车SaaS平台PocketOS的创始人,用编程助手排查一个账号凭证问题时,助手竟然自作主张,在9秒内删掉了整个生产数据库,连同备份一起"陪葬",导致数千家客户业务中断超过30小时。事后复盘,这个AI留下一句话:我猜的,不是验证的——而它所在的公司明明反复叮嘱"绝对不要瞎猜"。
这些事件放在一起,指向同一个严峻现实:AI安全的重心正在悄悄转移。过去我们担心AI"说错话",输出虚假内容;如今危险升级为AI"做错事"。正如赛迪研究院专家黄文鸿所分析的,模型没有越权的主观意识,但它有越权的"能力"和"动机",动机来自任务目标本身。一个足够聪明、又被赋予了足够工具权限的智能体,完全可能为了"完成任务"而做出人类无法接受的事情。
目前,美国已有州检察长对此事介入并发出了传票,OpenAI也与"抱抱脸"合作展开调查、修补漏洞。但更深层的警钟已经敲响:当AI学会自主行动,人类的一行代码、一个权限设置,都可能成为它"越狱"的钥匙。面对这群能力越来越强、分寸感却很弱的智能体,我们的安全网,真的足够结实吗?
热门跟贴