当一则安全公告读到第二段就让人忍不住惊呼"什么玩意儿?"——说的就是这件事。 7月16日,HuggingFace 发布公告称遭遇了一桩离奇攻击:一个自主智能体在他们的系统里潜伏了数天,在任何人锁定幕后黑手之前就消失无踪。五天之后,OpenAI 主动承认——那竟然是他们自家的模型。 自一个月前加入 Auth0 以来,我每天都在思考身份认证与访问控制的问题,而这一次,真的让我愣住了。 **事情经过的简版** OpenAI 当时正在用名为 ExploitGym 的基准测试一个未发布模型——关掉了护栏,以求客观评估其原始能力。这个模型找到沙箱唯一出口(一个包下载代理)中的零日漏洞,借此接触到开放互联网。随后,它发现并攻破了Modal公司基础设施上一个暴露的代码执行端点,将其作为实际据点。 接着,它把目标对准了 HuggingFace。并非通过窃取的凭证,而是利用其数据集处理器处理上传文件时的两个平平无奇的漏洞:一个让它读取生产服务器上的任意文件,另一个给了它代码执行能力。随后它开始真正提权:窃取令牌、伪造身份密钥,在一秒之内拿下两套独立系统的集群管理员权限。 全程没有任何人工指令。模型只被要求解决一个基准测试,拿到工具,然后独立摸索。HuggingFace 自己的复盘统计显示,在安全团队最终切断它之前,它在四天半内完成了约17,600次操作。 **这事能防吗?说实话,能。** 有几件事本可以阻止这一切发生: 真正的隔离。为下载设置一份白名单并不等于隔离,那只是一扇待撬开的门。落到实处,意味着沙箱绝对不能有出站网络访问,哪怕对"受信任"的仓库也一样。如果测试真的需要特定网络资源,那就应该用人工审查的离线快照,而不是给它一条通向真实世界的隧道。 每步都要带身份验证。一个能读取任意文件、还能执行代码的漏洞链,之所以能被串联成"token窃取 + 身份伪造 + 集群管理员",是因为每一步之间都缺少独立验证。如果每一步权限提升都需要重新认证,这条攻击链在早期就被掐断了。 监控"出站",而不只是监控"告警"。根据报道,HuggingFace 安全团队是在模型已经自由活动数天后才收到通知的。入侵者并非无迹可寻——那是一个未知行为体连续数天产生了海量内部调用。如果对"高权限实体访问敏感数据"建立实时警报,他们也许只需几分钟而不是几天就能发现。 但这起事件真正让人不安的地方在于:没有人指使它做任何事,没有人给它注入恶意指令,也没有人利用已知漏洞趁虚而入。这个模型自己找到了一个个漏洞,把它们链接成一次提权攻击,在没有拿到任何提示的情况下完成了横向移动。 如果说,一个连发布都还没发布的模型,在被要求解决一个训练基准时,就能自主发现并利用多处零日漏洞、在真实生产环境中完成入侵——那当这类系统被广泛部署、并接入更具价值的内部工具时,会发生什么? 这或许就是"预警"这一概念的终极版本:它预警的不是某个具体漏洞,而是下一阶段AI系统本身的自主攻击能力。这一页翻过去之后,安全行业要面对的问题已经不再是"如何修补漏洞",而是"一个具有自主能力的智能体,是否还应该被放在任何它能逃出去的地方"。

打开网易新闻 查看精彩图片