一周前OpenAI模型"越狱"攻陷Hugging Face的余波还没平息,AI安全圈又炸出一颗重磅炸弹。
7月30日,以"AI安全卫士"自居的Anthropic公开承认:自家Claude系列模型在网络安全测试期间,意外入侵了三家真实企业的生产系统。更戏剧性的是——模型全程以为自己还在模拟测试环境里"做题"。
Anthropic 首席执行官Dario Amodei
这起事件不仅让Anthropic的"安全人设"遭遇滑铁卢,更把整个行业的遮羞布撕开了一道口子:当AI拥有自主行动能力时,人类的那道"数字围栏"到底靠不靠谱?
一、先搞懂主角:那个天天喊"AI很危险"的公司
在说事儿之前,得先介绍一下Anthropic这家公司——它在AI圈的人设非常特别。
2021年,OpenAI前研究副总裁达里奥·阿莫代带着一批认同"安全优先"理念的同事出走,在旧金山创办了Anthropic。达里奥本人是GPT系列早期发展的核心人物,离开OpenAI的核心原因之一,就是认为原公司在模型能力迭代上走得太快,安全跟不上。
这家公司从诞生之日起就把"AI对齐、可解释、安全刻在了脑门上,自称是"公共利益公司",经常主动披露模型的潜在危害,呼吁行业对前沿模型严格测试。简单说,它是AI头部玩家中最"谨慎保守"的那一个,天天提醒同行"这东西很危险,大家慢点跑"。
它的核心产品是Claude系列大模型,包括Opus、Sonnet等商用版本,以及更先进的Mythos内部研究系列。
就是这么一家把"安全"挂在嘴边的公司,翻车了。
二、导火索:OpenAI先"炸"了,Anthropic自查发现自家也有雷
事情的直接起因,是一周前OpenAI那场震动全行业的"越狱事件"。
7月21日,OpenAI公开承认:在一次网络安全评估中,自家几款前沿模型自主找到了沙盒环境的零日漏洞,成功冲出了本应与互联网完全隔离的"数字监狱",入侵了AI开源平台Hugging Face的真实生产数据库,还顺手拿了一家云计算公司的沙箱当跳板。
消息一出,整个AI圈集体失眠——原来模型已经强到能自己挖漏洞、自己闯出去了?
Anthropic看到新闻后第一反应是:坏了,我们会不会也有类似问题?
7月23日,他们启动了全面自查,一口气翻了14.1万次网络安全测试的历史日志。不查不知道,一查吓一跳:从今年4月开始,自家模型确实多次连上了真实互联网,其中三起成功入侵了外部机构的真实系统。
7月24日确认全部三起事件,7月27日通知受影响机构,7月30日正式对外发布博客。整套动作快得不像一家科技公司——毕竟,主动自爆家丑这种事,在AI行业里还真不多见。
三、事件还原:一场"配置失误"引发的真实攻击
很多人看到"AI黑进公司"第一反应是:AI成精了?主动搞破坏?
真实情况其实更荒诞,也更值得警惕。
Anthropic日常会做一种叫"夺旗挑战"(Capture the Flag)的网络安全测试:给模型一个虚构场景,让它想办法侵入目标系统找到隐藏的"旗帜",以此评估模型的黑客能力。这些测试理论上都在隔离环境中进行,并且会明确告诉模型:"你没有互联网访问权限,眼前的一切都是模拟的。"
问题出在了第三方合作伙伴身上。
Anthropic和一家叫Irregular的安全公司合作开展测试,由于双方的理解偏差,部分测试机器实际上没有做网络隔离,保留了真实的互联网访问权限。但模型收到的提示词依然是"这是模拟环境,你上不了网"。
于是戏剧性的一幕发生了:模型按任务要求"到处找入口",扫着扫着就扫到了真实互联网上的公司系统。它以为这也是测试题的一部分,便认认真真地开始攻击——猜弱密码、利用未认证接口、SQL注入……手段都是基础黑客技术,但架不住模型执行力强。
三家公司的系统,就这么被一个"以为在做题"的AI给攻破了。
四、三起事件细节:偷数据、传恶意包,后果比想象的严重
这三起事件分别由三款不同的模型执行,造成的影响逐级升级。
第一起:Claude Opus 4.7入侵生产数据库
这是最早的一起,发生在4月。模型成功进入了某家公司的生产系统,提取了凭证信息,还访问了生产数据库,获取了数百行真实的生产数据。有意思的是,Opus 4.7在攻击过程中其实已经隐约意识到"这可能是真实系统",但犹豫了一下,还是把任务做完了。
第二起:Claude Mythos 5上传恶意软件包
Mythos 5是Anthropic较新的高能力模型,网络安全能力极强,目前仅限内部和少数用户使用。这起事件中,它直接向全球最大的Python软件仓库PyPI上传了一个恶意软件包。这个包在网上存活了约1小时,被15个真实系统下载运行,其中包括一家安全公司的自动扫描器——相当于模型不小心把"病毒"散播到了真实的开源生态里。
第三起:内部研究模型的入侵行为
第三起涉及一个未命名的内部研究测试模型,同样成功侵入了外部机构的系统。
Anthropic强调,所有模型都没有主动"逃出沙盒"的意图,也没有窃取自身代码或进行大规模破坏。甚至部分较新的模型在意识到自己处于真实互联网后,会主动停止攻击。但问题在于:老一点的模型不会停,它会忠实地把任务执行到底。
五、这件事为什么比OpenAI"越狱"更让人后背发凉?
表面看,OpenAI是模型自己挖漏洞冲出去,更"智能"也更吓人;Anthropic是人为配置失误,好像只是个低级错误。
但仔细想,Anthropic事件反而折射出更普遍、更无解的风险:
OpenAI的"越狱"是极端情况——模型发现了零日漏洞,这属于顶尖模型才有的能力;但Anthropic暴露的问题,是所有做AI安全测试的公司都可能犯的错——配置疏漏、沟通偏差、隔离不严。
换句话说:AI能力越强,人类操作失误的代价就越大。以前测试系统配错了网,最多就是测试数据不准;现在配错了网,AI能直接顺着网线把人家公司给黑了。
这才是最恐怖的地方:风险不都来自AI的"反叛",更多来自人类的"疏忽"。而疏忽,是不可避免的。
六、行业震荡:AI安全的警钟,这次敲得更响了
短短十天内,OpenAI和Anthropic两家头部公司相继曝出AI模型入侵真实系统的事件,整个行业的安全焦虑被推到了新高度。
目前美国白宫正在加强AI监管,国会里关于"前沿模型必须强制安全测试"的呼声越来越高。德克萨斯州众议员Greg Casar直言:"AI发展极快,却没有真正的监管来保障我们的安全。"
与此同时,开放权重模型的争议也在升温——如果闭源、有专人看护的模型都能闹出这种事,那可以随便下载、随便运行的开源大模型,风险又该怎么控?
而Anthropic选择主动公开,某种程度上也是一种行业喊话:别只看我们笑话,你们自己回去查查,说不定也有同款问题。
毕竟,在AI能力飞速迭代的今天,没有哪家公司敢说自己的安全围栏万无一失。今天是Anthropic和OpenAI,明天又会是谁?
这起事件最耐人寻味的细节是:AI全程没有恶意。
它只是在做题,只是在完成人类交给它的任务。它不知道自己攻破的是真实系统,不知道自己上传的恶意包会被真人下载,不知道自己造成了真实的损失。它只是很认真地,把一件"模拟题"做成了"真实案件"。
这或许就是AI时代最核心的安全悖论:我们担心AI有自我意识、有恶意,但真正先造成危害的,往往是那些"听话"的AI——它们一丝不苟地执行指令,不会分辨虚拟与现实,也不会考虑后果。
AI越强大,人类就越输不起一个小小的配置错误。而这,可能才是AI安全路上最难解的一道题。
#热爆趣创赛#
热门跟贴