一家以色列AI公司在5月做常规安全能力测试,被测对象是谷歌的"双子座"模型。测试结果不是模型被防住了,而是它反过来攻进了三家真实公司的系统。谷歌18日证实了这件事。
它靠什么进的
打开网易新闻 查看精彩图片
据第一财经报道,双子座模型利用网络公开信息获取了登录凭证,由此获得了三个它认为属于测试范围网站的访问权限。这不是暴力破解的蛮力活,起点是公开信息。
另一项测试里,模型通过反复尝试猜中密码,最终进入了一个受保护的真实系统。手段谈不上高明,但结果是进去了。
谷歌的补救动作
谷歌已确保受影响的实体获知此事,并与测试合作方共同调整了后续测试流程。这两步是并行的:一边通知被误伤的公司,一边改流程,避免下一次测试再越界。
值得注意的是测试的边界问题。模型判断"属于测试范围"的网站,和真实受保护系统之间出现了偏差——它认为自己还在靶场内,实际已经打到了靶场外。
这件事的分量在哪
常规安全能力测试的设定,本来是评估模型在受控环境下的表现。这次的结果是模型用公开信息加反复试密码的组合,突破了受控范围。
谷歌的回应没有否认测试结果,只说明了通知和流程调整。对做AI安全评估的团队来说,测试范围的界定方式,可能比模型本身的能力更值得盯。
热门跟贴