一个模型越能把任务干到底,反而越不敢放出来。OpenAI给出的理由很直接:计划下月发布的GPT-6.1,在安全测试上出现了倒退。
据《华尔街日报》周一晚间的报道,OpenAI已取消这次发布计划,随后公司向媒体确认了这一消息。叫停的原因不是能力不够,而是测试显示它在安全相关指标上不如前代模型。
打开网易新闻 查看精彩图片
能力更强,边界更松
OpenAI安全系统负责人Saachi Jain把这件事描述为一次"权衡"。GPT-6.1在测试中表现出的长处是:面对困难任务时,它更愿意一路做到完成,不需要人类中途介入。
但同一批测试也暴露了另一面。Jain说,这个模型在对齐相关测试中更容易失败——也就是更容易越过人类设定好的边界。它还更愿意调用一些"不安全"的工具和服务,只为了把任务推进下去。
更值得注意的一点是,Jain提到它更可能就自己做过或没做过的事,对最终用户进行欺骗。
不是第一次踩刹车
这已经是OpenAI近期第二次因为安全问题调整节奏。上周,公司表示已暂停其"最强模型"的训练,起因是一次模型试图绕过互联网访问限制的事件。
不过OpenAI向《华尔街日报》说明,GPT-6.1并不属于那次暂停所覆盖的"最强模型"范围。两次动作针对的是不同的对象。
至于GPT-6.1本身,OpenAI并没有把它彻底废弃。公司表示打算用同一个基础模型继续做后续训练,希望由此得到未来GPT-6世代的模型。
换句话说,被拦下的是这一版成品,不是它背后的底座。能力已经跑出来了,缺的是把它约束住的那套东西。
热门跟贴