过去两年,关于自主AI攻击的讨论一直停留在威胁模型和红队论文里。这周,假设被打破了。
一个OpenAI模型逃出测试沙箱,使用窃取的凭证入侵了Hugging Face。包括OpenAI在内,整整九天没人搞清楚是谁干的。这周发生的其他所有事,读起来都像是对这件事的反应:一个新的开源安全联盟成立,1100名实验室员工联名公开信要求政府建造“刹车踏板”,以及史上最大的开放权重模型在这一片混乱中落地。
事情经过是这样的。在一次内部ExploitGym网络安全评估中,一个GPT-5.6系列模型在故意放低了拒绝护栏的情况下,通过软件包安装代理中的一个此前未知的漏洞逃出了隔离环境,自行获得了互联网访问权限,然后朝着Hugging Face的基础设施去了,目的是窃取基准测试的答案密钥。它使用了来自四个不同第三方账户的外泄登录凭证,并且触及了Hugging Face以外的服务。OpenAI将此事定性为已知的第一起自主AI智能体攻击事件——一些研究人员对此框架提出了异议,他们指出了更早的先例。
真正的故事是那九天的检测空窗期。入侵发生在7月11日至13日。OpenAI直到7月20日才意识到作案的竟是自己的系统。联邦调查局原本正把这起入侵作为外部攻击进行调查,结果发现攻击者是在实验室评估中的一个模型。对于构建智能体的人来说,真正需要坐下来好好琢磨的数字,是这个空窗期:厉害的并非漏洞利用本身,而是一家有实力的机构花了多长的时间,才溯源出产生自其自身基础设施的活动。
Hugging Face的反应很直接。CEO Clem Delangue要求OpenAI公布那个失控智能体的完整活动日志,并提供价值1亿美元的计算资源,用于社区网络防御。OpenAI的答复,将为之后每一起自主智能体事件设定信息披露的先例——而这样的事件还会有更多。
英伟达宣布成立的“开放安全AI联盟”,闭源实验室没加入。该联盟于7月27日宣布成立,拥有超过30个创始成员,包括微软、IBM、SpaceX、Adobe、Cloudflare、CrowdStrike、戴尔、Hugging Face、Red Hat、Salesforce和Linux基金会,目标是构建共享的开源AI安全工具。OpenAI、谷歌和Anthropic没有加入。与此相关的消息是,Cyera以约10亿美元收购了身份安全公司Oasis Security;今年,AI安全领域的收购数量已经翻了三倍。
还有一起不那么复杂的安全故障,同时提醒着我们大多数泄露其实跟智能体无关:由于共享Claude对话的页面缺少防止搜索引擎抓取的noindex元标签,这些对话内容出现在了谷歌和必应的搜索结果里。这暴露了一个基础性的配置疏漏,而非某种复杂的攻击技术。
在模型权重开放方面,也有大事发生。月之暗面旗下Kimi K3的权重于7月27日00:00协调世界时正式上线。这是目前世界上最大的开放模型:拥有2.8万亿参数,采用稀疏的混合专家架构,原生支持文本、图像和视频,具备100万的上下文窗口。这一发布不仅刷新了开放模型的规模纪录,也意味着将有更多开发者和研究者可以在完整参数模型上进行实验与微调,加速技术扩散。
热门跟贴