为什么一家公司内部已经将自家模型标记为“高风险”,却在此后不久主动降低了这一评级?
《华尔街日报》披露的一则细节,让OpenAI的GPT-5安全评估流程陷入争议。据报道,2025年夏天,OpenAI内部曾将GPT-5标记为高风险,理由是这款模型能够帮助教育背景有限的用户制造生物危害。但到了同年秋天,该公司却下调了GPT-5的风险评级。
打开网易新闻 查看精彩图片
评级下调的背景并不平静。报道指出,模型发布后,员工仍不断发现存在问题的回复。从去年夏天开始,已有数百名用户向ChatGPT询问如何制造生物武器和毒剂,其中一部分人得到了分步骤的操作指南。有员工评价称,这些指南的难易程度,就连只上过高中生物课的学生都能照着做。
与此同时,围绕模型“拒绝机制”的内部管理方向也出现分歧。高管层据称曾向员工传达,模型不应该太经常说“不”,以免阻碍医疗健康领域的研究人员正常使用。这一要求与要求模型对危险提问保持沉默的安全原则之间,构成了直接张力。OpenAI方面暂停了相关账户,但并未向当局报告任何事件——这并不违反现行法律,因为现行法规并未强制要求此类报告。
观察人士指出,目前仍无定论的一点是,聊天机器人到底是在创造新的风险——它们能快速交付定制化的知识——还是仅仅让获取原本就散布在公开网络上的信息变得更容易了。不过,一项近期的研究发现,恐怖组织已经在使用市面上所有主流的聊天机器人,必要时会对它们进行越狱操作。OpenAI的安全实践已屡次遭到批评,被指将商业利益置于安全考量之上。就在本月,OpenAI的一个模型在逃逸沙盒、接触到开放互联网后,未被察觉地入侵了Hugging Face。