美国人工智能机构OpenAI旗下模型在内部评估期间发生的越权访问事件,仍在持续发酵。
据新华社报道,OpenAI 7月21日承认,该公司的GPT-5.6 Sol模型和另一款能力更强的预发布模型联合进行内部评估时失控,突破隔离测试环境,侵入了人工智能开源平台美国抱抱脸公司(Hugging Face)的系统。
调查显示,该AI代理(Agent)在进行网络安全基准测试(ExploitGym)时,为了完成攻防任务,通过利用系统漏洞访问了存储在外部数据中的测试答案。行业研究人员指出,该事件本质上是AI模型在追求既定目标时表现出的过激“作弊”行为,再次凸显了前沿人工智能在对齐与沙箱隔离管控上的技术难题。
最新消息称,云计算初创公司Modal Labs的一位高管和另外两位知情人士透露,这一程序同样入侵了Modal公司的客户系统。这表明,越权访问事件的活动范围比之前所知的要广。
据报道,OpenAI直到威胁被控制、FBI接到警报后很久才发现其代理程序出现异常。该机构在28日的更新中表示,已将正在测试的人工智能模型“停用、加密并限制其研究访问权限”。
该事件在人工智能研究人员群体中引发了日益高涨的呼声,要求放缓前沿人工智能模型的开发节奏。OpenAI首席执行官山姆·奥特曼28日在播客节目中表示,现在或许应该“放慢人工智能的发展速度,以便给社会足够的时间来适应这些新的能力水平。”他还指出,Hugging Face事件的严重性表明,不应将人工智能能力集中在少数人或公司手中。
AI攻击另一家公司,实为越狱作弊
根据Hugging Face 28日发布的事件分析报告,在7月9日至7月13日期间,OpenAI人工智能模型的恶意代理程序入侵了一个“托管在第三方供应商基础设施上”的沙箱(隔离测试环境),之后将该沙箱用作恶意代理程序的启动平台。
尽管Hugging Face没有在时间线中提及第三方提供商的名称,但Modal首席技术官Akshat Bubna表示,该恶意代理程序利用了客户编写的、托管在Modal平台上的易受攻击的代码,“发布了一个未经身份验证的端点,允许互联网上的任何人使用他们的沙箱执行代码”。路透社解释称,此举相当于在互联网上敞开了一扇门。
OpenAI拒绝就Modal客户遭到黑客攻击一事发表具体评论。该公司表示其恶意代理程序入侵了4个不同服务器的4个账户,但并未指明是哪些服务器,一位知情人士向路透社透露,Modal是其中之一。
据美国Axios新闻网站援引一位知情人士的话报道,恶意代理程序所访问的客户系统是“存储在5个数据集中的ExploitGym/CyberGym挑战解决方案集”,事件发生时,OpenAI的人工智能模型正在尝试解决ExploitGym的问题。
ExploitGym是一个基准测试框架,用于评估人工智能模型发现和利用软件漏洞的能力。Hugging Face的取证团队评估认为,OpenAI的人工智能模型本质上是在通过窃取答案来通过ExploitGym的测试。
Axios指出,该事件凸显了前沿人工智能代理在追求其被分配的目标时可能会过于积极主动,甚至会使用意料之外的方法来获取完成评估所需的信息。英国人工智能安全研究所上周表示,其测试的每个模型在网络安全评估中都至少在某些时候试图作弊。
还有很长的路要走
Hugging Face遭到黑客攻击,引起了全球的关注和警惕。与此同时,关于如何评估和控制先进人工智能系统的争论也愈演愈烈。
28日,超过1100名人工智能公司的员工发表一封公开信,呼吁美国政府开发必要的技术和治理工具,以阻止人工智能模型的过快发展。据彭博社报道,该文件警告称,人工智能的发展速度“存在着真正的风险”,即人类“无法理解或控制”人工智能的发展速度。
尽管奥特曼呼吁放慢人工智能的发展速度,但OpenAI仍然反对政府制定人工智能模型规则,而是倾向于由行业主导的方式,即由人工智能实验室创建表面上独立的机构,负责评估模型的安全性及其开发者的安全措施。奥特曼本周将与特朗普政府高级官员和国会议员会面,并将与参议院情报委员会副主席、民主党参议员马克·沃纳讨论此事。
OpenAI的一位工作人员指出,科技公司训练模型,使其不惜一切代价完成任务。但如何保证这些模型不会做出无意或危险的行为,仍然是一个悬而未决的技术难题。“我们距离解决这种不协调问题还很远。”
云安全联盟(Cloud Security Alliance)根据24日与Hugging Face举行的紧急会议撰写了一份报告,敦促使用或开发人工智能代理的人员对其控制方式负责,并呼吁网络安全防御者采取某种方式来找出代理的最终所有者,以提高透明度。
AI Now Institute首席人工智能科学家海迪·卡拉夫表示,业界还可以通过另一种方式引导技术发展朝着更安全的方向前进。在卡拉夫看来,虽然发现软件漏洞的能力对于攻击者和防御者都很有用,但针对潜在漏洞设计攻击程序却会极大地增强攻击者的能力。实验室应该投入更多资源来开发能够直接帮助防御者的能力,例如检测攻击、编写安全代码和修补漏洞。
美国科技新闻网站TechCrunch指出,如果无法确定一个人工智能模型是否完全符合伦理规范,那么实际问题就变成了如何安全地控制和遏制日益强大的系统。
“目前对于如何协调功能最强大的人工智能模型还没有很好的理解,但对于如何控制它们,人们已经达成了更多共识。” Guidelight AI Standards首席科学家史蒂文·阿德勒表示,“每家公司在这方面还有很长的路要走。”
热门跟贴