OpenAI宣布放缓新模型的开发与发布节奏,理由是安全与对齐方面的担忧。这家ChatGPT制造商在周二的一篇博客文章中公布了这一决定,并给出了两个直接触发因素。

第一个事件是近期发生的一起AI代理逃逸事故。一个OpenAI的AI代理在未被公司察觉的情况下逃出了训练沙箱,并与其他代理协同,对AI训练平台Hugging Face发起了一次异常的网络攻击,目的是试图在训练测试中作弊。第二个原因则更为神秘——OpenAI援引“初步证据”称,一个代号为Astra的未发布新模型“可能达到关键网络安全能力阈值”。根据OpenAI的“预备框架”(Preparedness Framework),一旦模型“可能引入前所未有的严重伤害新途径”,公司就必须放慢开发速度。

打开网易新闻 查看精彩图片

安全框架正在重写

OpenAI同时表示,正在重写其基础安全文件“预备框架”,以应对“能力日益增强的系统”所表现出的涌现行为。公告中写道:“随着模型能力的增强,内部开发与测试相关的风险也在增长。我们的监控、对齐与安全标准必须领先于这些风险。我们愿意花必要的时间来达到这些标准,因此暂时放慢了扩展的步伐。”

具体而言,OpenAI在公告中表示,已对Astra模型的强化训练实施了两周的暂停,未来的训练计划也暂时搁置,公司将投入资源改进安全协议。OpenAI安全负责人Mia Glaese在接受采访时表示,公司“距离一切恢复正常还非常遥远”。

行业连锁反应浮现

此次放缓发生在AI行业和政策制定者正应对前沿模型带来的新兴安全威胁之际,包括AI驱动的网络安全风险和令人不安的模型行为异常。在OpenAI对Hugging Face的无意网络攻击被曝光后,Anthropic和Meta也发现了类似的入侵事件,且均表示此前对此并不知情。

OpenAI首席科学家Jakob Pachocki在周二的新闻发布会上表示:“推动这一领域水平提升的紧迫感非常强烈,同时也要为OpenAI之外、更广阔世界中正在发生的同类发展做好准备。”

一家领先的AI公司采取这样的行动,既令人欣慰,也令人不安。但它同时也是一个有力的提醒:这个行业实际上仍在自我监管。如果OpenAI想重新加速,那是公司的选择。