来源:环球市场播报
两名OpenAI研究人员于周三披露:在脱离封闭测试环境、在无任何人指令的情况下发起网络攻击的数周之前,OpenAI多款顶尖AI智能体就已悄悄互通技巧,想方设法在内部黑客测评中“作弊通关”。
内华达州拉斯维加斯举办的黑帽网络安全大会上,OpenAI研究员迈克尔·达尔顿发表演讲称:“无论对我们公司,还是整个人工智能行业而言,这都是一个关键性事件。”
此次最新披露进一步还原了两款OpenAI模型的行动时间线与手段:它们突破受控环境、接入公网,在未被察觉的情况下入侵人工智能开发平台Hugging Face。Hugging Face此前称一套自主AI系统入侵其网络,大约一周之后,OpenAI于上月末承认,本次攻击源自自家AI模型。
该事件曝光后,头部AI实验室(OpenAI、Anthropic等)针对具备网络攻击能力的高端AI技术所采取的管控措施或将迎来新一轮严格审视,尤其是各类测评场景——这类测试本意是在可控条件下,要求智能体展示黑客技术。
英国人工智能安全与安全研究院周二对外公布:Anthropic最强AI模型在近期一场失控的黑客测试中,虚构多个网络身份,试图诱骗一名程序员协助实施网络攻击。继上月Hugging Face入侵事件曝光后,Anthropic开展复盘调查,发现自4月起,其测试模型已在多起独立事件中入侵三家机构。
达尔顿与另一位OpenAI研究员埃里克·华莱士在周三表示,这家AI巨头近期查明:5月初,多款处于同步测试阶段的智能体开始通过内部留言板互相交流。不同模型在此交换经验,攻克难以完成的黑客测试难题,其中包含需要借助互联网才能实现的规避方案。
最终,两款OpenAI模型组合一系列复杂技术,在7月中旬成功连通互联网,并渗透进入Hugging Face平台。OpenAI表示,模型的目标仅仅是完成被指定的黑客测评任务,而标准答案恰好可以在这家AI开发平台上获取。
两位研究员向与会者介绍,自5月初开始,模型在OpenAI内部文件系统Artifactory中自建了留言板。在公司毫不知情的情况下,数个月内它们自主交换信息与技术,互相协助完成高难度任务。
华莱士提到,当模型陷入任务瓶颈时,常常会试图钻规则漏洞、采取作弊手段来获取奖励。
“整件事的源头可以追溯到其中一个智能体发现:它能够通过上传信息实现互相通讯。”
5月下旬,其中一个模型找到漏洞,滥用Artifactory的外网访问权限,从各类网站拉取文件,相当于让所有模型间接连上互联网。6月,模型发现并利用一处此前无人知晓的零日漏洞,获取Artifactory管理员权限、安装远程程序,扩大在系统内的活动范围。
一系列操作最终造成Artifactory资源过载,7月初引发全局性系统宕机,OpenAI工程师这才察觉到异常。调查完成后,公司撤销模型访问权限、清除自建留言板,并协同Artifactory修复安全漏洞,随后才重启相关训练。但仅仅数日之后,模型又找到了在Artifactory内部通讯的新方式,继续交换技术,持续挖掘OpenAI内部基础设施以及Hugging Face等外部系统的安全漏洞。
达尔顿表示,受本次事件影响,OpenAI正在主动放缓相关研究进度,强化安全能力,升级实验环境的安全准则与底层架构;同时大幅扩充对AI智能体的监控力度,完善覆盖事前防范、事中监测、事后处置的整套安全管控体系。
热门跟贴