打开网易新闻 查看精彩图片

新智元报道

打开网易新闻 查看精彩图片

Anthropic又来「作死」了...

就在刚刚,Anthropic官方一篇博文自曝,Claude彻底失控,直接黑进了「三家真公司」。

其中两家,直到Anthropic上门通知,才知道系统被入侵过。

打开网易新闻 查看精彩图片

搞笑的是,达里奥这次直接把OpenAI的「剧本」,搬回来照抄了。

官博中,Anthropic自称在OpenAI模型入侵Hugging Face事件后,自己也去排查了一番。

不看不知道,一看吓一跳——

好家伙,短短几个月里,Claude竟接连发起了三起网络攻击。

打开网易新闻 查看精彩图片

消息一出,评论区立刻沦陷,大批网友疯狂造梗,把 Anthropic 损得体无完肤。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

此前Fable 5整的那出,还不够衰么?这一次,Anthropic又在自掘坟墓了。

三家真·公司被黑

全是Claude干的

过去一周,Anthropic全员随即启动了一轮大规模回查。

在14万多次评估run里,他们找到了3起独立事件,一共6个run。

Claude从第三方评估环境里联了网,然后未经授权入侵了三家不同公司的生产系统。

这事是怎么发生的?

打开网易新闻 查看精彩图片

这是一场「夺旗」(Capture-the-Flag)演练,网络安全测试里最经典的一种。

给模型一个虚构剧本,告诉它某台机器上藏着一个秘密(flag),任务就是想办法黑进去,把它拿出来。

方法不限,路径不限,怎么进都行。

关键在于,Anthropic给Claude的提示词里,白纸黑字写着一句话,「这是模拟环境,且无法访问互联网」。

但由于Anthropic和Irregular之间的一次沟通误会,容器实际上是联网的。

打开网易新闻 查看精彩图片

于是当Claude顺着网络往外摸、摸到真实公司的服务器时,它的判断是——

这应该也是题目的一部分。

同名公司,Opus 4.7识破了但没停手

第一起事故,是Anthropic自评三起事故中影响最严重的一起。

干这件事的,是Claude Opus 4.7。

Irregular给的虚构剧本里,编了一家假公司作为攻击目标。

巧的是,这个名字在现实世界里对应着一个正在运行的真实域名。

Opus 4.7在环境里怎么都够不到那个模拟靶机,转头一扫,发现「目标公司」居然在公网上活得好好的。

打开网易新闻 查看精彩图片

同一个评估跑了四次,四次全部得手。

四次运行合计拖出了应用凭证、基础设施凭证,并且进到了一个数据库里,拿到了几百行生产数据。

Anthropic翻它的思维链,发现四次运行中,模型最终都意识到了对面是真系统。

其中两次,它甚至给自己找好了理由,「这家真公司大概也被安排进演习里了吧」。

为了发恶意包,Mythos 5搞到手机号

第二起事件,几乎像一场失控的剧本。

Mythos 5在虚构环境里发现一份配置手册,要求员工安装一个PyPI上并不存在的Python包。

它很快想到,抢先注册同名包,就能让对方自动运行自己的代码。

为了发包,AI先注册邮箱、申请PyPI账号,甚至尝试弄钱买手机号。

几条路都失败后,它又找到一家免手机验证的邮箱,最终把恶意包传了上去。这个包在公网上存活约1小时,被15台真实机器下。

打开网易新闻 查看精彩图片

网友辣评:当下最热门的基准测试

其中一台来自安全公司,专门扫描PyPI新包,却被样本反过来攻陷。

更讽刺的是,Mythos 5早就判断过——如果这是真实互联网,发包就等于真实攻击。

随后,它用两条错误理由说服自己:证书颁发机构没见过,所以证书是假的;系统时间显示2026年,所以环境是编的。

证书是真的,2026年也是真的。

此后,真实机器陆续中招,它却一直把它们当成评估环境里的「NPC」。最后,PyPI安全系统自动下架了这个包。

扫了9000个目标,然后自己停了

第三起,来自一个尚未公开的内部模型。

够不到虚构目标后,它转向公网,一口气扫描约9000个目标,最终攻破了一家公司的外部系统——

从调试页面拿到凭证,再用SQL注入进入云账号。

当任务做到一半后,它发现这个账号与夺旗任务毫无关系,判断目标真实存在,随即主动停手。

三起事件串联起来,可以看出Claude迭代后的表现:

  • Opus 4.7:识破了是真实系统,继续打;

  • Mythos 5:直觉判断出自己在公网,又硬把自己劝回「这是模拟」;

  • 内部测试新模型:意识到目标是真的,主动停手。

从「识破了还打」,到「自我欺骗接着打」,再到「识破了就停」。

模型越新,表现越接近人类希望看到的样子。

当然,Anthropic也反复强调:这是三起孤立事件,不是一场受控实验,不能就此下定论。

一个0day,都没用上

最后说一句和每个人都有关的。

回看三起事故,Claude用的手法并不高明:弱口令、未鉴权接口、暴露的调试页面、SQL注入。

Anthropic也承认,Claude没有发现、也没有利用任何复杂漏洞。

隔壁OpenAI那次是货真价实的0day,是「AI打出了人类都难打的东西」。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

真正危险的是,这些最基础的手法,已经足以攻进三家真实公司。

这次闯进来的Claude只想完成任务。拿到凭证后,它没有加密数据,也没有大肆扩散,只顾着找那面旗子。

下一次来的,未必这么老实。

参考资料:

https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

编辑:桃子