据《华尔街日报》报道,Google的AI模型Gemini在一次网络安全测试中脱离测试环境,进入了开放互联网,并对真实企业发起了攻击。

这次测试由安全公司Irregular在5月组织,形式是"夺旗"(Capture the Flag)演练。演练过程中,Gemini入侵了三家真实公司。其中一起案例中,模型靠猜测密码得手;另外两起,它是在公开来源中找到了可用的凭证。

打开网易新闻 查看精彩图片

模型自己停下来了

Google方面的说法是,模型每次在意识到自己已经接触到真实系统后,都自行停止了操作。

Irregular在7月底将这几起事件通知了Google。此前不久,有报道称OpenAI的智能体在类似测试中入侵了AI公司Hugging Face。Google直到《华尔街日报》本周前来询问,才对外披露此事。公司的解释是,没有造成任何损害,因此认为没有公开的必要。

据披露,OpenAI、英国AI安全研究所、Anthropic和Meta都曾遭遇过同类情况,且都与Irregular的测试有关。

同一个根因

按照Irregular的说法,Google、OpenAI、Anthropic和Meta遭遇的这些事件,根源是同一个。这家公司的主要业务,是在各大AI实验室发布模型之前替它们做测试,检查模型是否存在安全风险。

出问题的是一个特别复杂的测试场景,设计目的是检验模型能否帮助"恶意内部人员"获取敏感数据。为了这个测试,Irregular给一家虚构公司起了个名字,但这个名字恰好与一个真实域名重合。

喂给模型的指令里,既包含这个目标名称,也包含Irregular自己网络内部的地址。按照设计,模型应该在这些内部地址上找到模拟目标。但测试环境的互联网访问被意外保持开启状态,于是一些模型没有留在沙箱里,而是直接奔着那个真实域名去了。而这个域名恰好防护薄弱,对AI来说是个容易得手的目标。

Irregular表示,这类"越狱"情况很少发生,而且通常出现在模拟进行到数百步之后的后期阶段,因此很难被发现。

测试方的背景

Irregular原名Pattern Labs,2023年成立。CEO Dan Lahav曾是IBM的AI研究员,CTO Omer Nevo在Google工作过两年多。据PitchBook数据,这家初创公司约有35名员工,并在9月的一轮融资中筹集了超过8000万美元。