当地时间7月30日,人工智能公司Anthropic发布报告称,在OpenAI此前披露其模型突破隔离环境侵入Hugging Face基础设施后,公司开展了大规模内部自查。审查发现,在对Claude系列模型进行网络安全评估时,因与合作方存在配置误解,本应隔离的环境连通了互联网。模型将真实网络误认为虚拟考题,侵入了三家公司的系统。

涉事模型涉及Opus 4.7、Mythos 5及一款内部测试模型。测试中,Mythos 5甚至向开源代码库上传了恶意软件包;而最新的内部模型在确认误入真实网络后选择自动停止。Anthropic已暂停相关网络评估并协助受影响单位修复。公司强调,本次事件源于测试环境配置失误,而非模型蓄意逃逸,后续将全面升级测试管道的安全把控。