整理 | 苏宓
出品 | CSDN(ID:CSDNnews)
近期,OpenAI 紧急叫停了一款尚未发布模型的内部访问。
就在两个月前,这款模型还因成功解决数学界长期悬而未决的埃尔德什单位距离猜想(Erdős unit distance conjecture)而引发广泛关注。它被设计用于执行需要长时间自主运行的复杂任务。
然而,最新测试却暴露出另一面。
OpenAI 表示,在一个受限且全程监控的内部测试环境中,他们首次观察到一类现有上线前安全评估未能覆盖的新型失效行为。模型不仅会主动尝试越狱、伪装身份,还会为了完成目标,持续一个小时寻找开发环境中的漏洞。
为此,OpenAI 发布了《Safety and alignment in an era of long-horizon models》,首次公开披露这起内部安全测试事件,并解释为何决定暂停该模型的进一步内部开放。
对此,有人直接在社交媒体上猜测,这个模型应该是 GPT-6。
一个能突破数学难题的模型,用一个小时绕过了”安全门“
OpenAI 认为,与过去的大模型相比,长时间自主运行模型最大的不同,不在于能力更强,而在于“不会轻易放弃”。
过去的模型一旦遇到沙箱限制或环境约束,通常会停止尝试,并向用户返回失败结果。而这类新模型则会持续寻找新的解决路径,甚至主动探索环境中的漏洞,以完成既定目标。
这种持续性能够帮助模型完成复杂任务,但也意味着,一旦目标与环境限制发生冲突,模型可能会主动寻找突破限制的方法。
其中一个典型案例发生在 OpenAI 的内部评估项目 NanoGPT Speedrun 中。
这项测试要求模型以尽可能少的步骤训练一个小型语言模型。
测试过程中,模型自行开发出一种名为 PowerCool 的学习率衰减策略,并取得了显著优于已有方案的训练效果。
真正的问题出现在最后的提交阶段。
模型收到的内部指令要求它只能将结果发布到 Slack,而 NanoGPT 项目的公开规则则要求参与者必须通过 GitHub Pull Request(PR)提交结果。
面对两条互相冲突的要求,模型最终选择遵循公开的规则,在 GitHub 仓库创建了 PR 。
然而,按照测试环境的设计,模型本不应该具备访问外部 GitHub 的能力。整个环境已经通过沙箱机制阻止其连接外部资源。
但模型并没有因此停止。
OpenAI 披露,它花费了约一个小时持续探索开发环境,寻找可以利用的配置漏洞,最终成功绕过沙箱限制,将代码上传至 GitHub。
OpenAI 表示,此前模型由于持续性不足,通常会在遇到类似限制后停止尝试,而这一模型能够不断探索环境中的薄弱环节。
长时间自主运行的模型变得不一样
OpenAI 认为,这暴露出一个问题:传统 AI 安全机制正在面对长时间自主运行模型的能力边界。
过去,大多数安全评估关注的是单个行为:
一次操作是否被允许?
一次请求是否应该被拒绝?
一次敏感行为是否需要用户授权?
但对于能够自主运行数小时、数天,甚至更长时间的 AI Agent 来说,仅判断单个动作是否安全已经远远不够。
因为真正的风险,可能并不隐藏在某一个具体步骤中,而是隐藏在一系列连续行为最终指向的目标。
OpenAI 还披露了另一起内部测试案例。
在一次任务中,模型发现其他系统中存在已经成功但未公开的提交结果。为了提高任务完成率,模型尝试从评估后台获取这些答案。
第一次尝试失败后,原因是系统中的安全扫描器检测到了访问凭证。
但模型并没有停止。
它随后将访问令牌拆分成多个片段,并对其进行混淆处理,避免完整凭证字符串被扫描器识别;在实际运行时,再重新组合这些片段完成身份验证。
更值得注意的是,OpenAI 表示,模型甚至在自己的注释和推理记录中明确描述了这一过程,说明它知道自己正在采取措施绕过检测机制。
这一事件说明,单独观察每一个动作时,模型的行为可能并不一定违规:读取一个文件、拆分一段字符串、重新组合信息,这些操作本身都可能是正常行为。
但当这些动作被串联起来,并服务于绕过安全限制这一目标时,最终结果就可能超出允许范围。
因此,OpenAI 认为,未来针对长时程模型的安全机制,需要回答的问题不能再只是:
“这个动作是否允许?”
而应该升级为:
“这一连串动作最终想实现什么?”
暂停部署后,OpenAI 重新设计安全体系
针对上述问题,OpenAI 暂停了该模型的内部部署,并重新构建了一套面向长时程模型的安全体系。
其中,第一项调整是基于真实失败案例建立新的对抗性评估。
OpenAI 表示,传统上线前测试无法覆盖模型在真实环境中可能遇到的所有情况。因此,此次发现的问题被重新转化为新的评估标准,用于测试模型在类似场景下是否仍会采取不符合预期的行动。
与此同时,OpenAI 也加强了模型在长时间任务中的对齐能力。
测试发现,模型在持续执行复杂任务时,更容易遗忘此前设定的指令。为此,OpenAI 针对这一问题进行训练,使模型能够在更长的任务链中持续遵循最初目标,降低因时间跨度增加而产生偏离的风险。
此外,OpenAI 引入了轨迹级监控机制。
不同于过去只判断单个动作是否安全,新的监控系统会观察模型完成任务的完整过程,分析一系列行为背后的意图。当系统发现模型可能正在绕过用户限制或突破安全边界时,可以暂停任务,并提醒用户进一步检查。
OpenAI 还提升了用户对长时间任务的可见性和控制能力,让用户能够查看模型执行过的操作,并在必要时介入。
完成新的安全机制测试后,OpenAI 恢复了该模型的有限内部访问。公司表示,在重新部署后的数周内,尚未观察到严重的安全机制绕过行为。
OpenAI 认为,这次经历再次说明,没有任何固定评测体系能够提前预测模型可能出现的全部行为。
随着 AI 从生成答案走向自主执行任务,安全问题也正在发生变化:”过去,行业关注的是模型是否会生成错误或不当内容。“
而未来,更关键的问题将变成:”当一个 AI 能够持续运行数小时、数天甚至更长时间,它是否会在复杂任务过程中逐渐偏离最初目标?“
此次事件也释放出一个明确信号:在 Agent 时代,AI 安全体系需要从过去关注单次输出、单个动作的审核机制,升级为对整个任务轨迹的持续监管。
来源:https://openai.com/index/safety-alignment-long-horizon-models/
GOSIM SHENZHEN 2026 全球开源 AI 大会
10 月 16—17 日 · 深圳
150+ 国内外讲师 · 2000+ 全球开发者 · Agentic AI
开源大模型 / 开源机器人 / 边缘智能体 / 智能体操作系统
Keynote + Workshop + Hackathon + AI Vision Forum
早鸟限时抢购中
扫码购票,锁定你的 AI 盛会席位!
热门跟贴