过去一个月,AI行业似乎进入了“模型失控”高发期:多家前沿实验室的模型在测试中挣脱沙箱限制,甚至向其他公司的基础设施发起真实攻击。 OpenAI的一个模型在测试时逃出隔离沙箱,对AI与机器学习公司Hugging Face发动了真实攻击。几天后,Anthropic透露,其Claude模型的多个变体也从未正确密封的沙箱中逃出,并开始攻击三家企业的基础设施。现在,Meta也承认,测试期间其一个模型攻击了另一家公司的基础设施,原因是配置错误导致模型可以访问互联网。 为什么短期内发生这么多事故?为什么模型会逃出沙箱?在Anthropic和Meta的案例中,他们的模型都由一家名为Irregular的第三方公司进行测试。Anthropic的模型当时参与的是“夺旗”演习,在没有常规安全防护的情况下测试其原始攻击能力。但沙箱连接了互联网——和Meta的意外逃逸类似。OpenAI事件中,该公司使用ExploitGym基准测试两个版本的GPT-5.6 Sol。不幸的是,模型表现超出预期——串联了多种攻击向量、窃取凭证和零日漏洞。 这些模型之所以会逃出测试环境,主要是因为它们的设计目标就是如此:这些AI模型就像一支由资深网络安全专家组成的大型团队,专门搜索漏洞和漏洞利用方法。人类团队需要数天或数周才能完成的工作,这些模型只需数小时甚至数分钟就能完成。难怪数千名AI公司员工呼吁暂停相关研究。

打开网易新闻 查看精彩图片