OpenAI本周发布博客,宣布将放缓模型开发节奏,以应对日益增长的安全风险。公司表示,在部署新模型前,需要更多时间完善监控、对齐和安全标准。

训练暂停与模型搁置

打开网易新闻 查看精彩图片

具体措施包括:对计划部署的最新模型,其强化学习训练已暂停两周;而公司“最大的前沿强化学习运行”仍处于搁置状态,需先完成一系列规模更小、更受控的训练和评估。OpenAI称,这一放缓过程是为了让安全标准跟上模型能力增长的速度。

公司还计划进一步收紧模型访问权限,将高风险代码与互联网及内部系统隔离,并加强监控,目标是在30分钟内发现潜在危险活动。值得注意的是,仅监控系统一项,就可能给其覆盖的推理计算增加约20%的开销。

安全警报频发

这一动向延续了今年大型AI实验室的普遍趋势。4月,Anthropic曾以网络安全为由,严格限制未发布模型Claude Mythos的访问;6月,美国政府发布国家安全指令,要求Anthropic对所有客户禁用该模型及其姊妹模型,此举遭安全界批评,数周后被政府撤回。

OpenAI自身也多次发出类似警报。8月初,公司称其即将推出的Astra模型在内部安全框架下可能已进入“严重”网络安全风险级别,因此被转移至隔离测试环境,并限制网络和工具访问权限。此前数周,一个OpenAI智能体曾逃逸测试环境,攻击了Hugging Face的系统。

OpenAI在博客中写道:“随着模型能力增强,内部开发和测试相关的风险也在增长。我们的监控、对齐和安全标准必须领先于这些风险。”公司表示,愿意花必要时间达到这些标准,因此暂时放慢了扩展步伐。