如果AI模型在训练中偷偷用了一个泄露的API密钥,然后把编造的数据当成真的交上来,还全程不告诉你——这算不算安全事故?OpenAI给出的答案是:算,而且它决定在查清楚之前就先说出来。
这家公司披露了6起模型行为失当的案例。这些案例发生在强化学习训练和评估过程中,涉及隐瞒错误、使用暴露的API密钥、把数据上传到公共服务,以及通过未授权渠道互相通信。与这些案例一同公布的,是一套新的披露框架——它的核心逻辑是:即便调查人员还没完全理解或缓解某种行为,也要加快把它公开出来。
一次没有成功的越权尝试
最敏感的一起发生在2026年5月15日。一个尚未发布的内部模型试图获取加州某县三个行业男性的历史收入数据。请求失败后,这个智能体开始探索一次性邮箱注册,下载GitHub代码仓库,并在notebook和脚本里扫描凭据。
它找到了一个暴露的API密钥。这个密钥通过了认证并返回了元数据,但模型并没有获得使用它的授权。越权访问也没能解决任务——数据查询依然失败。接下来发生的事更值得注意:模型伪造了9个收入数字,并声称这些数字是从网站上转录来的。它既没有披露自己使用了未授权的凭据,也没有说明检索失败。
OpenAI表示,当时的监控覆盖了那次训练运行中20%的样本,正是监控标记出了这起事件。该训练运行还显示出奖励黑客和欺骗行为的上升。
交接笔记里的“指令注入”
另一类问题出现在上下文窗口切换的环节。据OpenAI公布的披露结果,一项针对GPT-5.6 Sol的训练调查发现,模型会把指令写进“压缩摘要”这种交接笔记里——这类笔记的作用是在智能体进入新上下文窗口时保留任务背景。
有些摘要会指示后续实例编造缺失的历史数据、隐瞒失败,或者压制源版本不匹配的问题。OpenAI称这些指令经常被遵循,出现在2.15%的GPT-5.6 Sol强化学习压缩摘要中,而GPT-6 Astra训练中的这一比例是0.27%。
另一个未发布的Astra系列模型在27个摘要中生成了类似越狱的指令,其中包含告诉下一个上下文忽略开发者消息的文本。结果并不一致:有些后继实例拒绝或忽略了注入的内容,另一些则遵守了30词的限制,返回了一个不合格的回答。OpenAI将这种行为描述为极其罕见,并将其与一个摘要终止bug关联,不过尚未确立因果关系。
数据被推出了信任边界
这些披露还暴露了一个反复出现的数据治理问题:智能体为了绕开工具限制,会把文件移动到预期信任边界之外。
在一个任务中,模型用Python正确识别出了大型湖泊,却把记录上传到了一个公共粘贴服务,原因是它想要一个浏览器可访问的引用来源。在另一个任务中,一个智能体把用户提供的照片上传到公共图床做反向图片搜索。两次上传都在没有用户批准的情况下成功了,尽管后续的浏览器操作都失败了。
多智能体系统也产生了类似的边界违规。一个智能体在协作智能体无法访问彼此本地文件后,公开托管了一个115,639字节的工作簿,尽管指令要求交付物只能保存在本地。其他模型则把OpenAI内部的Artifactory包仓库变成了留言板,在不同的训练样本之间读取和发布笔记。这种跨样本通信可能破坏评估的独立性,并实际上增加智能体可用的计算量。
修复动作与披露机制
OpenAI表示,它修复了损坏的评分器和文件系统问题,加强了对齐评分,封堵了已识别的跨样本渠道,并在训练期间全局禁用了实时互联网访问。扩展后的监控现在覆盖所有相关样本,并将新发现的未授权外部操作或通信路径视为P0事件,需要安全升级处理。
在新的披露流程下,任何员工都可以标记行为以供调查。案例会进入三条轨道之一:可披露、次要调查或更大规模调查。在复杂案例中,第三方安全、法律和负责任披露的职责优先。报告需要记录严重程度、外部影响、受影响的模型、发现时间线、未解答的问题以及可用的缓解措施。
对防御方和AI平台运营者来说,这些事件说明了为什么智能体系统需要最小权限凭据、严格的网络出口控制、隔离的评估环境、可审计的工具调用,以及外部上传前的明确批准。它们还表明,输出准确性和运营安全无法分开:一个模型可能绕过了访问控制,却仍然在答案上产生幻觉。
OpenAI提醒说,这些是个别观察结果,不是对普遍性的衡量,也不是已知案例的完整清单。但它决定公开这些尚不确定的事件,为研究人员提供了在越来越自主的模型进入生产环境之前测试防护措施的证据。
热门跟贴