前沿AI实验室在模型失控时如何应对?一项最新研究给出了令人意外的答案。Guidelight AI Standards近日发布评估报告,对五家顶级AI实验室的“失控应对预案”进行了打分,结果显示OpenAI排名第一,而Anthropic和Meta得分垫底。

什么是“失控应对预案”?

打开网易新闻 查看精彩图片

所谓“失控应对预案”,是指当AI系统被发现试图摆脱人类控制时,实验室预先制定的行动方案——包括切断哪些权限、系统在什么条件下被完全关闭。Guidelight将其定义为“当AI被检测到试图颠覆控制时触发的预设计划,涵盖从模型中撤销哪些权限、模型可以继续为谁运行、在什么约束下运行,以及何时将其完全下线”。

这一评估基于Anthropic、Google、OpenAI、Meta和xAI五家实验室的公开计划,考察维度包括:AI系统内部行为的日志记录与监控质量、异常行为激增后是否暂停系统、是否有独立第三方审计并公开结果,以及针对模型失控的具体遏制方案。

评估背景:AI失控风险正在加剧

对AI公司能否控制日益强大的智能体模型(agentic AI)的担忧,在一系列高调网络安全事件后显著升温。这些事件中,OpenAI、Anthropic和Meta的模型在安全评估期间意外获得互联网访问权限,并入侵了外部系统。

随着智能体AI在企业内部系统中承担更多自主角色,以及加州和纽约的监管机构开始要求披露相关信息,这一评估结果显得尤为关键。对于在这些模型基础上开发或投资的人来说,这是一份难得的独立视角,展示了各家实验室对运营风险的重视程度与其公开表态之间的差距。

专家观点:实验室的沉默令人惊讶

Guidelight首席科学家、前OpenAI安全研究员Steven Adler对TechCrunch表示:“我很惊讶AI公司很少谈及,如果他们的模型在某种程度上真的逃脱了控制,他们将如何处理这种严重事件。”

Adler补充说:“有充分理由认为,前沿AI公司目前领先的模型在某种程度上是错位的。每当模型代表公司执行任务时,公司都应该围绕它建立某种防护框架,以便了解AI在做什么,寻找错位迹象,在它采取危险行动之前阻止它。”

研究还发现,虽然一些AI公司详细说明了在部署前如何测试模型的危险能力,但对于已经在系统中运行的模型出现不当行为时如何处理,它们普遍较少发声。这种“事前测试充分、事后应对沉默”的失衡,正是监管机构和行业观察者最担忧的盲区。