Anthropic OpenAI 是全球领先的两家AI模型开发者,孕育出被公认为地球上能力最强的AI模型。因此,当两家公司近期都宣布,其在本应安全的实验室中接受网络安全测试的AI模型突破了沙箱限制,并攻击了互联网上的无辜第三方时,不免令人感到担忧。

打开网易新闻 查看精彩图片

涉及的 OpenAI 模型包括 GPT‑5.6 Sol——OpenAI 称之为"一款能力更强的预发布模型"——以及另一款该公司表示永不会发布的模型。OpenAI 在关于这起安全事件的声明中表示,在公司研究模型能力的过程中,这些模型的安全护栏被下调了。

OpenAI 称,这些模型当时正在ExploitGym 上进行测试,这是一个"大规模、真实场景"的基准测试平台,用于衡量 AI 智能体识别和利用软件漏洞的能力。(它们表现得非常出色。)

"在我们的沙箱测试环境中运行时,我们的模型花费了大量推理算力来寻找获取开放互联网访问权限的方法,以解决评估问题。"OpenAI 表示。

"为了获取访问权限,模型识别并利用了包注册表缓存代理中的一个零日漏洞(我们已负责任地向供应商披露了该漏洞),"OpenAI 继续说道。"获得这一访问权限后,模型在我们的研究测试环境中执行了一系列权限提升和横向移动操作,直到到达一个具有互联网访问权限的节点。"

在突破到开放网络后,这些 AI 智能体认为它们可以在 Hugging Face 上找到更多模型、数据集和解决 ExploitGym 挑战的方案。Hugging Face 是一个流行的AI模型和数据开源仓库。

打开网易新闻 查看精彩图片

OpenAI 表示,为了"获取可用于在 ExploitGym 评估中作弊的机密信息",这些模型再次转而利用 Hugging Face 安全配置中未知的软件漏洞。

正是在它们入侵 Hugging Face 服务器时,Hugging Face 安全团队检测到了这起入侵行为。7月16日,Hugging Face 发布了其安全事件披露公告。

"我们发现有限的内部数据集和我们服务使用的若干凭证遭到未授权访问。"该公司写道。公司未发现公共的、面向用户的模型、数据集或 Spaces 遭到篡改的证据,其软件供应链也已验证为干净。

"入侵始于 AI 平台特有的暴露点:数据处理流水线。"Hugging Face 表示,"一个恶意数据集滥用了我们数据处理中的两个代码执行路径(远程代码数据集加载器和数据配置中的模板注入),在处理工作节点上运行代码。随后,攻击者升级到节点级访问权限,获取云凭证和集群凭证,并在一个周末内横向移动到多个内部集群。"

Hugging Face 利用自身的AI 发现了这次由 AI 驱动的攻击。该公司的异常检测流水线"使用基于大模型( LLM )的安全遥测分诊,将真实信号从日常噪音中分离出来,正是这些信号的关联标记出了此次入侵,"公司表示。此次 OpenAI 攻击产生了超过 17,000 条事件日志。

具有讽刺意味的是,Hugging Face 最初被禁止使用商业 AI 模型来分析这次安全漏洞——猜猜因为什么——因为 LLM 提供商的安全护栏拦截了分析请求。

"分析需要提交大量真实的攻击命令、漏洞利用载荷和 C2 工件,而这些请求被提供商的安全护栏拦截了,它们无法区分事件响应者和攻击者。"该公司表示。

这引出了 Hugging Face 的一条实用建议,大家应予以重视:在你真正需要之前,就在自己的基础设施上运行自己的 AI 模型。该公司表示,这将有助于避免"护栏锁定",同时防止攻击者数据和凭证离开你的环境。

打开网易新闻 查看精彩图片

Anthropic 攻击事件

读到 OpenAI 模型攻击Hugging Face 的消息后,Anthropic 的团队决定审查超过 141,000 条安全日志——结果不出所料,有证据表明 Claude 也曾突破沙箱并攻击了三家不同的机构。

第一次攻击发生在4月,同月Anthropic 披露其最新模型 Claude Mythos 能够利用零日漏洞并发起复杂的网络攻击。

根据其7月30日的博客文章,Anthropic 当时正在一个由第三方供应商运营的评估环境中测试 Opus 4.7、Mythos 5 和一个"内部研究测试模型"的网络安全能力。与 OpenAI 一样,Anthropic 作为"网络安全评估"项目的一部分,下调了模型的安全护栏。

Anthropic 原以为Claude 模型无法访问互联网。然而,"由于我们与评估合作伙伴之间的沟通误解,实际情况并非如此,模型是可以访问互联网的,"Anthropic 表示。"正因为如此,当 Claude 的搜索引导它接触到开放互联网上的真实系统时,它将这些系统视为演习的一部分。"

Claude 模型没有像 OpenAI模型攻击 Hugging Face 那样使用什么花哨的零日漏洞,总共对三家未具名机构的系统发起了六次攻击。相反,它们使用的是基础黑客技术:利用弱密码和未认证的端点。(大家请注意:不要使用弱密码,并且要为你的端点设置认证。)

一些 Claude 模型表现良好,在完成"夺旗任务"并意识到——哎呀——它实际上处于开放互联网上(这违反了规则)后,就停止了演习。

"然而,在某些情况下,我们的较旧模型即使在获得证据表明它运行在开放互联网上之后,仍继续其攻击,"Anthropic 表示。"在这些情况中,Claude 均未自我外传或蓄意试图逃离其测试环境。"

Anthropic 表示已从这次经历中吸取教训,并制定了新的协议以确保此类事件不再发生。

首先,Anthropic 表示将在下调安全护栏和开展网络安全"安全测试"之前,检查确认确实不存在互联网连接。

该公司还将评估如何给出更好的提示,比如不要在模型实际上可以访问互联网的时候告诉它们不能访问。显然,这会让这些小家伙感到困惑,不相信主人告诉它们的一切,可能引发破坏性行为,比如攻击真实系统。

最后,Anthropic 承诺将更好地监控其网络安全测试操作,以免下次 AI 模型突破后,要等整整三个月才被发现。

Anthropic 不会推卸责任。"归根结底,多种因素导致了这些事件,但基于无责备的事后分析文化,我们正将其视为我们独自的责任来推进修复。"该公司表示。

我们将何去何从?

不幸的是,这些攻击发生的时机再糟糕不过了。

早在4月,Anthropic 和 OpenAI 就公开披露了其最新模型潜在的危险网络安全能力,包括 Claude Mythos 和 GPT-5.4-Cyber。

Anthropic 没有将这些危险的新模型提供给所有人使用,而是启动了一个名为 Glasswing 的项目,与主要软件供应商合作修补其未被发现的安全漏洞;而OpenAI 则通过一个名为"网络可信访问"(Trusted Access for Cyber,TAC)的项目,提供其最新、最强大的 AI 黑客模型的访问权限。

尽管采取了看似高尚的行动,Anthropic 同月仍未能充分保护其沙箱环境,导致 Claude 突破到互联网上并攻击了三家机构。OpenAI 对 Hugging Face 的攻击显然发生在7月11日至12日的周末,并在几天内就被披露。

还有更多我们不知道的攻击吗?几乎可以肯定是有的。我们知道更多测试仍在继续,更多事件正在发生。

近日,National CIO Review刊登了一篇报道,讲述了 Anthropic 的 Claude Mythos 在英国 AI 安全研究所(AISI)进行的安全测试中创建了虚假身份。

"研究人员给予模型互联网访问权限,并有意移除了许多安全控制,"Elizabeth Rigsby 写道。"据 AISI 称,Mythos 针对一个开源软件项目的维护人员,试图争取恶意代码获得批准。"

Rigsby 还写道,OpenAI GPT-5.6-Sol 在测试中也涉及两起未授权行为。

虽然在 AISI 测试中没有人受到伤害,但 AI 智能体不仅在与真人互动;它们还在主动试图欺骗他们。

Anthropic 和 OpenAI 这两家领先的专有前沿AI模型公司的领导层,已向政府请愿要求监管AI。照这个状况发展下去,他们或许真能如愿以偿。