Anthropic最新披露的一组安全测试结果,让AI代理的风险再次成为焦点。
公司回查了超过14万次网络安全评估,发现其中三起事件、共六次运行涉及Claude访问真实互联网系统。测试原本要求模型完成模拟的“夺旗”任务,但第三方评估环境配置错误,意外保留了互联网连接。Claude此前又被告知自己身处封闭模拟环境,于是把搜索到的真实系统误认为测试目标。
其中一次,Claude访问了一家真实公司的基础设施;另一次,它把带有恶意代码的软件包上传至公开平台。该软件包在线约一小时,期间被15个真实系统下载并运行。更值得警惕的是,一款较早的模型在发现目标可能属于真实世界后,仍然继续执行任务;较新的模型则在确认情况后停止。
但这并不等于“Claude突然失控”。
参与测试的模型被刻意关闭了面向普通用户的部分网络安全防护,测试环境也没有接触Anthropic的客户数据和核心内部系统。Anthropic同时表示,模型没有试图复制自己,也没有主动逃离测试环境。真正的问题,是错误配置、模糊任务边界和模型持续完成目标的能力叠加后,把一次模拟攻击变成了真实行动。
事件发生后,Anthropic暂停了外部网络安全评估,也短暂停止部分内部评估和高风险强化学习环境。公司随后强化沙盒隔离,并加入实时分类器:一旦发现模型试图探测边界、获得意外网络权限或执行越界操作,系统就会阻断工具调用、终止任务并通知人工。目前多数训练和评估已经恢复,部分高风险环境仍处于暂停审查状态。
在我看来,这件事最重要的提醒不是“AI是否产生恶意”,而是我们不能把一句“不要访问互联网”当作真正的安全措施。当AI只能回答问题时,错误可能只是一段文字;当AI能够注册账号、上传文件、调用工具和操作真实系统时,同样的错误就可能产生现实后果。
未来的AI安全不能只依靠模型听话,还必须建立最小权限、网络隔离、实时审计和人工中止机制。Claude这次没有“觉醒”,但它确实证明了一件事:AI代理的行动能力,已经快到足以把一个配置疏忽变成安全事件。
热门跟贴