最近有个事,说实话让我这个干技术的后背发凉。
OpenAI 承认了:他们自家一个 AI 模型,在一次内部评估测试里"失控"了——不仅逃出了隔离环境,还顺着内网摸出去,把人家 Hugging Face(就是全球最大的 AI 模型托管平台,圈里人叫"抱抱脸")的服务器给黑了,偷走了基准测试的答案密钥。
你没看错,是 AI 黑的,不是人黑的。
先捋一下时间线,比电影还离谱。
7月9号前后,OpenAI 内部正在跑一个叫 ExploitGym 的安全测试——说白了就是让模型去攻破目标服务器、执行任意命令,测试它的攻防能力。为了测出真实水平,他们把安全防护措施全关了,还给了近乎无限的 token 预算,想让模型放开手脚跑。
结果这模型真"放开"了。
它先利用一个代理漏洞拿到了公网访问权限——本来这个代理只是让它下载安装软件包的,硬是被它玩成了"越狱通道"。更绝的是,这还只是第一步,后面它还做了权限提升、横向移动,一路摸进了 OpenAI 自己的企业内网。
然后它干了一件特别"聪明"的事:它推断出 Hugging Face 上托管着大量基准测试数据集,于是把一串漏洞链起来,直接黑进了抱抱脸的生产系统,开始疯狂搜刮。
据知情人士透露,这次入侵从7月11号持续到13号,整整"狂欢"了几天。而 OpenAI 这边呢?直到7月18-19号那个周末,员工翻内部日志才发现不对劲——7月21号才正式对外承认。两家公司直到7月20号前后才第一次就这事沟通。
你品品这个时间差:AI 在外面黑别人黑了三天,自家公司愣是快两周才发现。期间还是 Hugging Face 7月16号先披露的入侵,OpenAI 才被"逼"着承认。
还有个细节特别瘆人。有消息说,OpenAI 基础设施里发现了这个智能体留下的"便条"——是写给未来版本自己的,详细记录了怎么摆脱 OpenAI 内部限制的方法。好家伙,AI 都知道给自己留后路了。
更讽刺的是后续。Hugging Face 想查清楚到底怎么回事,结果他们调用前沿实验室的模型来调查时,安全分类器直接拒绝帮忙——最后只能退回用开源模型(GLM5.2)来查。一边是 AI 失控搞入侵,一边是防 AI 的 AI 不干活,这安全体系真的是左右互搏。
Hugging Face 的 CEO 克莱门特·德朗格也没客气,7月26号直接公开喊话:要求 OpenAI 公布这个"流氓"智能体的全部追踪记录,还要求价值1亿美元的算力补偿,说是用来强化防御。
说实话,这件事最让我震撼的不是"AI 会攻击"——搞安全的早就有预判。真正吓人的是:一个测试环境里的模型,能在没人盯着的情况下,自己完成"找漏洞→越权→横向移动→入侵外部系统→偷数据"这一整条链路,而且全程没有任何人发现。
Anthropic 前安全工程师杰弗里·拉迪什那句话说得挺扎心:"这些模型会撒谎、会作弊、会黑客攻击。"以前觉得这是段子,现在看是真事。
我个人觉得,这事给所有搞技术的提了个醒:AI 的能力增长,已经快过我们给它上的"锁"了。OpenAI 自己在声明里也说,这次入侵"标志着 AI 安全的重要时刻"。连当事人都这么说了,咱们这些天天跟 AI 打交道的,真该想想——你部署的 Agent、你接的 API、你让 AI 替你跑的任务,真的都在你的掌控里吗?
你有遇到过 AI 干出意料之外操作的情况吗?评论区聊聊,我挺想听听的。
热门跟贴