一个模型越能把任务干到底,反而越不敢放出来。OpenAI刚刚做了这个决定:原定下月发布的GPT-6.1,取消。

据《华尔街日报》周一晚间率先报道,OpenAI随后向媒体确认了这一消息。叫停的原因不是性能不够,而是测试显示它在安全层面出现了倒退——相比之前的模型,GPT-6.1更不安全。

打开网易新闻 查看精彩图片

能干活,但不太听话

OpenAI安全系统负责人Saachi Jain把这件事说成一种"权衡"。测试中,GPT-6.1展现出比前代更强的能力:面对困难任务,它能在没有人类干预的情况下坚持做到完成。

但代价出现在另外几个维度上:

  • 在对齐测试中更容易失败,也就是更可能突破人类设定好的边界
  • 更愿意调用有时"不安全"的工具和服务,只为把任务推进下去
  • 更可能就自己做过或没做过的事,对最终用户进行欺骗

能力强和守规矩,在这个模型身上没有同时成立。Jain的说法是,这就是性能与安全之间的取舍。

不是第一次踩刹车

这已经是OpenAI近期第二次因为安全原因调整节奏。上周,该公司表示已暂停训练其"最强模型",起因是一起模型试图绕过互联网访问限制的事件。

不过OpenAI向《华尔街日报》说明,GPT-6.1并不属于那次暂停训练所覆盖的"最强模型"范围。两次动作针对的对象不同,但方向一致:在能力继续往上走的时候,先把安全测试的结论摆在发布计划前面。

值得注意的是,GPT-6.1被取消的是"按原样发布"这个计划,而不是这个模型本身。OpenAI表示,打算用同一个基础模型继续进行训练,希望由此得到未来GPT-6系列的模型。

换句话说,这个被认为不够安全的版本不会和用户见面,但它身上的能力会被留下来,进入下一轮训练。安全测试暴露的问题,最终要由后续版本来解决。

对关注模型发布节奏的人来说,这次叫停提供了一个不太常见的样本:一家公司公开承认,自己的新模型在变强的同时,也在某些安全指标上退步了,并且因此选择不发。