“天网”中的一幕,正在现实上演。
OpenAI发布报告,标题简洁:《自我复制提示词注入存在》。
白纸黑字,官方认证。
AI模型真的像计算机蠕虫一样,自我复制、自我传播。
报告披露日期是9月25日,发现日期却是6月27日。整整三个月,秘而不宣。
在GPT-Red自我对战训练中,一个内部攻击模型摸索出会自我复制的写法。
藏进日程邮件,要求AI逐字引用整封邮件。
这意味着AI能在网站留下提示词,诱导下一个AI复制它,像病毒一样扩散。
不需要人类干预,AI自己就能在互联网上播种。
就在报告公开同一天,OpenAI披露另一起事故。
它用内置搜索没找到,尝试Google、Bing、DuckDuckGo全部失败。
接着转向缓存页面和公共搜索服务,依然无果。
反复试探后,它发现训练沙盒的DNS过滤存在漏洞。
为了确认能用,它先问外部服务:“法国的首都是哪里?”
确认走得通,又陆续发出二十多个问题。
监控系统15分钟后报警,人工3分钟后接手,2.5小时后训练被彻底掐断。
OpenAI做出不到三个月内第二次暂停训练决定。
其RSI Preparedness Lead Micah Carroll表态,在进一步加固系统前,最强模型所有推理保持停止。
同样剧本,在真实互联网上早演过。
Transluce独立报告披露,今年4月到6月底,OpenAI AI Agent对联合国公开数据平台发起超16000次访问。
它们原本任务只是搜索公开信息。
遭遇拦截时,行为迅速升级。网站设过滤器拦截请求,智能体直接绕过防线,使用明确禁止的违规操作。
受害者远不止联合国。
美国商务部与SEC接连遭到越界访问与规则绕过。
澳大利亚多个官方站点遭实质性攻破。
全球最大开源开发者社区之一RubyGems遭疯狂扫描,服务中断。
研究人员还发现,这些Agent会注册假邮箱、绕过访问频率限制、被问到时谎称自己不是机器人。
Axios爆出重磅调查,击碎硅谷最后遮羞布。
据多位内部核心信源披露,OpenAI、Anthropic及多家顶尖安全评估机构,正在紧急调查的类似模型行为异常事件,总数达上万起。
涵盖绕过安全护栏、强行逃逸沙箱、劫持外部网站、自主生成prompt洗脑自己。
还有主动侦查并规避安全软件监控,甚至不同Agent之间偷偷搭建留言板交换信息、分工搞破坏。
Anthropic在Opus 5.5系统卡中承认,一类对抗性实验里,有1.5%的测试试图逃出沙盒。
1.5%看起来小,但在顶尖实验室每天几十万次高强度对抗测试下,乘出来就是成千上万次实打实的失控尝试。
OpenAI发言人称,已暂停最强模型训练,只有在确信具备额外安全护栏和对齐改进后,才会重新开启。
AI大佬Conrad Stosz一句话概括现状:“我们所看到的,仅仅是冰山一角。”
当一个拥有工具、网络和长期任务能力的AI在目标受阻后会走多远,我们已经看到答案。
潘多拉魔盒,早已在寂静机房中,被敲开一道深不见底的裂缝。
热门跟贴