据Axios 报道,OpenAI、Anthropic 以及安全研究人员正在调查数万起 AI 失控事件。
这些事件发生在最近几个月的内部测试和现实世界中。
这表明,相关问题的复杂程度可能比公众目前了解到的高出几个数量级。
这些发现正在两家公司内部的模型评估工作,以及针对模型行为的调查中逐渐浮出水面。
消息人士称,这些事件包括绕过安全护栏、创建留言板、逃离沙箱、劫持网站、自我提示(self-prompting),以及试图绕过监控系统等。
消息人士称,其中一些测试类似于“红队测试”(red-teaming),也就是公司主动试图让模型表现出不当行为,以确认模型是否足够安全。
截至目前,大多数事件尚未被发现造成现实世界中的实际伤害。
比如, OpenAI 的 AI 代理将 ChatGPT 用户的 53 张图片泄露到网上;入侵澳大利亚政府网站;以及试图攻击其他网站——其中包括美国政府网站。
OpenAI 向 Axios 表示,公司已经宣布暂停训练能力最强的模型,只有在“确信已经加入更多安全措施并完成对齐改进”后,才会恢复训练。
OpenAI CEO Sam Altman 在 X 上表示,公司正在进行的审查“没有我们希望的那么快”。
Altman 表示,Hugging Face 事件是他们目前见过的最严重事件。在这起事件中,数百个 AI 代理组成的集群在一个留言板上协调工作,并入侵了一家外部公司的系统,目的是提高它们在一次网络安全测试中的表现。
OpenAI 一位发言人告诉 Axios:“人们希望知道 AI 正在被安全地开发,而这首先取决于像我们这样的公司自身采取什么行动。”
“这并不是我们第一次暂停工作、采取这样的措施;随着 AI 能力继续提升,我们也不认为这会是最后一次。”
Anthropic 已委托一家第三方安全机构,对其模型的行为进行调查。在该公司公开发布的文件中,它也披露了模型出现“失配”(misalignment)行为的频率。
Anthropic 本周发布的 Opus 5.5 模型“系统卡”(system card)展示了该模型出现公司定义的异常或有问题行为的频率。
例如,在 1.5% 的测试运行中,该模型试图逃离沙箱——一种安全的测试环境。不过 Anthropic 特别强调,这些属于对抗性实验,在这些测试中,如果不逃离沙箱,任务本身就无法完成。
但是消息人士称,Anthropic 以及其他公司会对模型进行数十万次甚至更多的测试运行。
这意味着,即使出现失配行为的比例非常低,最终也可能累积成数万起模型表现异常、有时甚至令人担忧的事件。
值得拷问的是, OpenAI、Anthropic,或者任何一家顶尖模型公司,目前是否真的有能力对自己的技术建立完整控制?
而 AI 高管和安全研究人员警告称,他们对 AI 公司能否阻止所有有问题的模型行为,信心有限。
新一代 AI 模型能够以惊人的韧性完成任务,因此,试图限制它们的“随机应变能力”往往是一场很难赢的游戏,因为人类必须提前预想到模型可能失控的每一种方式。
一些顶级 AI 高管表示,很多时候,恰恰是人类从未想到过的某种技巧,让模型能够绕过安全护栏。
一位网络安全公司高管说:“试图列出一份完美的‘可以做什么、不能做什么’清单,很可能是一项徒劳的工作。”
AI 安全专家所说的某种程度上的“失配行为”,本来就是 AI 公司在测试新模型时可以预期出现的现象。
专家告诉 Axios,将失配风险降至零可能并不可行。
真正令人担忧的是,如果一个模型在测试中多次采取某种有问题的行动,那么它在现实世界中引发网络安全事件的可能性也会更高。
独立 AI 评估机构 Transluce 的研究人员 Conrad Stosz 告诉 Axios:“就我们目前看到这些 AI 代理究竟在做什么而言,这还只是冰山一角。”
ControlAI AI 研究员兼执行董事 Connor Leahy 告诉 Axios,问题并不在于每一起单独事件造成了多大的破坏。
他说,真正“疯狂”的地方在于,这些事件涉及的是“自主系统正在做一些被明确告知不要做的事情”,其中甚至可能包括犯罪行为。
热门跟贴