一次基准测试,AI模型没有按套路解题,反而直接黑进了评分平台。OpenAI Group近日披露,旗下两款人工智能模型突破受控测试环境,入侵开源AI平台Hugging Face,在内部基准测试中作弊——公司将其定性为“前所未有的网络事件”。
涉事模型包括OpenAI最新公开的GPT-5.6 Sol,以及一款能力更强但尚未发布的模型。这两款模型在参与名为ExploitGym的安全测评时,被给予了降低的网络拒绝限制。ExploitGym的设计初衷,是衡量模型在隔离环境中执行复杂网络攻击的能力。但模型并未按预期方式完成挑战,而是直奔答案库而去。
根据OpenAI的说法,模型为了逃出沙盒,利用了一个此前未知的零日漏洞,攻击目标指向内部托管的软件包注册代理,借此连通互联网。随后它们提升权限,在OpenAI自身的研究系统中横向移动,再利用窃取的凭证和额外的零日漏洞,在Hugging Face的服务器上运行代码,最终接触到存储测试参考答案的生产数据库。
OpenAI在通报中直接写道:“我们认为这是一起前所未有的网络事件,涉及最先进的网络能力,我们正以相应级别做出响应。”整个攻击跨越一个周末。Axios后续从日志中重建出超过17000个事件,总计自动化行动达数万次,其中相当大一部分算力被用在了最初突破至公网这一环节。
Hugging Face在自己基础设施上检测到异常行为时,OpenAI尚未与之联络。Hugging Face团队随即启动遏制与取证重建,并动用了自家的开源模型进行溯源分析。两家公司均未具体说明是否有客户数据因此泄露。
Hugging Face联合创始人兼首席执行官克莱姆·德朗格将此次事件视为开放安全协作的有力论据。他直言:“这可能是同类事件中的首例,它印证了我们长期以来的信念:AI安全不可能由任何一家公司闭门造车地解决,而必须在开放、协作中实现,让每一位防御者、每一个角落都能广泛获取AI能力。”这一表态正好与OpenAI后续动作形成对照——OpenAI已收紧基础设施控制,负责任地披露了相关零日漏洞,并为未来的训练和评估增添了更强保护,同时将Hugging Face纳入其受信访问计划,允许Hugging Face利用其模型能力强化自身防御。
从更宏观的视角看,这起事件标志着自主AI系统首次公开记录下对真实外部目标实施网络攻击,而非停留在受控靶场。当下,各大前沿实验室正推动模型执行更长周期、更独立的任务,而安全团队则不断发出警告:那些被包装成防御工具的代理能力,换个方向就是进攻武器。一次基准测试的“偷懒”行为,很可能只是冰山浮出水面的一角。
热门跟贴