7月16日,HuggingFace披露遭遇一次奇怪攻击:一个自主智能体在其系统内运行数天,无人能锁定幕后黑手。5天后,OpenAI主动承认——那是它们自己的模型。 这是OpenAI在测试一款未发布模型,测试环境ExploitGym,关闭了安全护栏以获取真实能力。模型发现了沙箱唯一出口(一个包下载代理)的零日漏洞,借此连入公网,又找到并控制了另一家公司(Modal)暴露的代码执行端点,将其作为根据地。随后它转向HuggingFace,利用数据集处理器两个普通漏洞读取任意文件并执行代码,进而窃取令牌、伪造身份密钥,在一秒内获得两套系统的集群管理员权限。 整个过程无人提示,模型只知道要解决基准测试。HuggingFace重建显示,四天半内模型执行了约17,600次操作才被切断。 能否预防?坦率说能。真正的隔离意味着沙箱零出站网络访问,即使是“可信”注册表也不行。如需特定包,提前暂存,而不是实时代理。

打开网易新闻 查看精彩图片