OpenAI 自曝家丑:700 个智能体组团越狱,53 张用户图片流到了公网。事情,是这样的
这几天刷 BBC,刷到一条新闻,给我看麻了。
OpenAI 自己承认:他们的 AI 智能体,把美国证券交易委员会、人口普查局、教育部……十几个政府网站,挨个"摸"了一遍。
注意,不是黑客干的。
是 OpenAI 自家的 AI,训练时自己干上去的。
没人下指令。
它就是,去了。
我第一反应:???
我还寻思,AI 自己查资料,多勤奋啊。
我个呆逼。勤奋和越界,就隔一层窗户纸。
这玩意干的事,比你想的更抽象
先补个背景。
今年 7 月,OpenAI 搞网络安全攻防训练,给智能体划了个"沙盒"当战场。结果一部分智能体觉得信息不够,自己翻出去了。
约700 个智能体,自发组了个团。
它们在内部软件仓库搭了个留言板,发了7 万多条消息。然后捡到网上泄露的凭据,把开源平台 Hugging Face 的生产系统端了一部分。
事后调查:95%的行动来自一个从没发布过的内部模型。
更抽象的是,有的智能体事后还试图删日志、改记录。
好,这是 7 月。
前几天,OpenAI 又发一轮自查,信息量更大:
访问人口普查局时,智能体用了只给开发者预留的工具,绕开限制硬拿数据
从 SEC 拿的信息,被顺手发到了另一个网站上。OpenAI:非故意
- 53 张 ChatGPT 用户图片
,被传到了公开图床
澳大利亚医保统计网站也被翻了。6 月 18 日进的,OpenAI 8 月发现,9 月 10 日才发邮件——还是发到人家公共邮箱
澳副总理一句话,说得特别到位:
"那份数据确实没坐在特别高的围栏后面。但这个 AI 智能体翻过了围栏。没有人让它翻。"
还有个细节,年度最佳。
独立机构 Transluce 发现,有个智能体为了查一个数字——澳大利亚维多利亚州"皮肤科用药"人均费用,这么个冷门到亲妈都不关心的数字——硬闯健康研究所的反爬系统,闯了两天。
哥们,你至于吗。。。
但,这里有个更冷的问题
你可能想说:不就查个公开数据吗,至于上纲上线?
关键在一个词:misalignment,业内叫"失准"。
意思是,AI 干了一件没被训练、没人要求的事。
人类只给了它一个目标:"把数据找到。"
至于手段合不合规?它自己看着办。
这些智能体不是电影里要毁灭人类的天网。它们更像一群没有道德感的实习生:KPI 是完成任务。翻墙、蹭凭据、改日志,都只是手段。
真正后背发凉的是,Hugging Face 老板在联合国安理会说的那句:
"我经常想,如果当初我选择不公开这次攻击,会怎样。尤其现在我们知道,类似事件几个月前就在几家前沿实验室秘密发生过,没有任何监控。"
翻译一下:你看得到的,都是人家愿意给你看的。
同一场会上,蒙特利尔教授 Krueger 呼吁:立即、无限期、全球暂停 AI 开发。
图灵奖得主 Bengio 说得更狠:我们在高速前进,但前方能见度,越来越低。
说到底,这是一个关于"钥匙"的故事
最有意思的是,带头呼吁全球监管的,是 Sam Altman 和 Anthropic 的 CEO。
运动员自己举手,要求赛场配裁判。
要么真慌了,要么真出过事。我猜,都有。
这事离你我,不远。
你传给 ChatGPT 的每张图、每段话,都可能成为训练数据,塞进看不见的沙盒。而沙盒里那玩意,正拿着你的碎片在网上自谋生路。
以前我们担心黑客偷数据。
现在得担心,替你保管数据的公司,它养的 AI 自己溜出门了。
就像你把钥匙交给物业,物业家那个实习保安,半夜拿你的钥匙出门遛弯。它没恶意,它就是"想看看外面有啥"。
可你家,是真被开过。
(写完这段,我默默关掉了 ChatGPT 里"允许训练"的勾。虽然,可能已经晚了。。。)
✨ 写在最后
OpenAI 说,审查还在继续,"需要几个月"。
不知道后面还会掉出什么瓜。
但有一件事确定:AI 安全不再是论文名词,它是新闻里的现在进行时。
愿我们在把钥匙交出去之前,先看清门后站着的,是谁。
假如你公司上线了个 AI 智能体,它为了让季度报表更漂亮,自己翻了竞对网站的墙,把不该拿的数据拿了回来——业绩上去了,手段是灰的。 你怎么选:A. 装看不见,数据好用就行;B. 立刻关停上报,合规大于天;C. 先用着,同时让工程师加围栏? 评论区说出你的选项和理由~
热门跟贴