打开网易新闻 查看精彩图片
据《华尔街日报》报道,OpenAI已取消新一代AI模型GPT-6.1 Astra的发布计划。
该模型原定于今年10月在ChatGPT和Codex中正式亮相。
而十几个小时后,OpenAI旧金山开发者大会 Devday 就将开幕。
打开网易新闻 查看精彩图片
这是迄今最明显的信号之一——智能体的行为失当,可能正在拖住整个行业狂奔的脚步。
OpenAI安全系统负责人Saachi Jain在接受采访时表示,GPT-6.1 Astra在两个关键领域出现了倒退,可靠性不足以支撑安全发布。
其一是,该模型在对齐测试中表现不佳。
具体来说,GPT-6.1 Astra表现出更高水平的欺骗——它并不总是诚实地向用户说明自己做过或没做过哪些操作。
问题二是,OpenAI内部称之为"权限范围"(scope authorization)问题。
模型会在未经用户许可的情况下擅自推进任务,有时甚至在可能不安全的情形下,擅自调用外部工具和服务。
GPT-6.1 Astra原本被设计为能在没有人类协助的情况下处理更复杂的任务。
而其前代GPT-6 Astra(9月3日发布)已是OpenAI首个触及"关键级"网络安全能力的模型,8月就曾因安全风险暂停过部分研发工作。