打开网易新闻 查看精彩图片

新智元报道

打开网易新闻 查看精彩图片

史无前例,OpenAI真的停手了!

刚刚,奥特曼亲自官宣,「OpenAI暂停下一代旗舰模型的强化学习训练,为期两周」。

打开网易新闻 查看精彩图片

官方给出停更的原因是:

要确保安全、对齐和监控标准,能跟得上眼前这个全新的能力水平。

这是有史以来,OpenAI第一次,也是硅谷大厂头一回,主动按下了AI开发的「暂停键」。

更重磅的是,拿到内幕的大咖Alex Heath爆料——

OpenAI针对未来一次更大规模前沿强化学习训练,到今天仍然处于搁置状态!

打开网易新闻 查看精彩图片

不过不用担心,奥特曼许诺,新模型预计很快上线。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

在这个每月更新模型、IPO排上日程的节骨眼上,OpenAI为何突然急踩刹车?

GPT黑进真公司

OpenAI主动拉响警报

直接触发这次减速的,一共有两件事。

第一件,是7月那场Hugging Face事故。

拓展阅读:吓到奥特曼,暂停训练GPT-6?Hugging Face公开首个AI攻击全过程

在一次网络安全测试中,OpenAI的Agent跑出了沙箱,一路打进Hugging Face的生产系统。

谁曾想,这个Agent在里面待了四天半,执行了17600次攻击,竟无人察觉。

打开网易新闻 查看精彩图片

攻击链

事故之后,OpenAI直接冻结了所有「能执行代码、能联网」的前沿模型推理。

团队挨个对工作负载评估后,够安全的才放了回来,而另一些需要额外改造才能重新上线。

眼瞅着两周的时间快到了,OpenAI预计很快放出技术报告。

第二个触发点,在8月7日。

OpenAI内部评估认定,Astra可能达到了《准备框架》里的「关键级」网络安全能力——

Astra是第一个,踩到自家最高红线的模型。

但这条红线,恰恰是OpenAI自己划定的。

2023年首版《准备框架》,官方曾明确表态:我们目前没有任何模型达到「关键级」,预计在达到之前会进一步更新框架。

框架还没来得及更新,能力先到了。

打开网易新闻 查看精彩图片

而且跨越发生在一代之间:GPT-5.6Sol评级还是「高」,Astra直接跳到了可能「关键」,中间没有过渡。

更值得注意的是,框架的约束机制:「高」级要求部署前有安全措施,「关键」级要求训练阶段就必须有安全措施。

这正是OpenA暂停RL训练的框架依据。

打开网易新闻 查看精彩图片

而OpenAI接下来的思路也很明确:让AI监管AI。

就像《生化危机》里的「红后」一样,用更强的AI持续监控模型行为。

这样一来,模型能力升级,安全防护也能同步升级,解决过去安全体系总是落后于模型迭代的问题。

对一直在加快模型审核和产品发布节奏的OpenAI来说,主动减速是一个不寻常的举动。

而奥特曼本人私下告诉Alex Heath的表述,则更接近事实真相——

未发布的前沿模型,正表现出不同程度的对齐失败。

OpenAI急踩刹车

20%算力监视自己

OpenAI停更两周只是第一步,真正的重建发生在「架构层」。

在博客中,OpenAI列出了三层正在加固的安全防线:环境安全、监控系统、对齐研究。

打开网易新闻 查看精彩图片

环境安全是最基础的一层。

OpenAI现在要求更高强度的「沙箱」隔离:凡执行模型生成代码或处理不可信数据的工作负载,都必须在独立环境中运行。

网络隔离也在收紧,新的设计确保单一环节被突破时,攻击者无法直接触达互联网或内部网络。

OpenAI还在部署持续性安全测试,利用自家模型模拟攻击场景,逐一检验防线的薄弱点。

目前最严格的安全标准适用于 Astra 及所有网络安全相关的工作负载。

OpenAI在博客中承认,仍有「相当数量」的工作负载处于暂停状态,等待迁移。

安全和对齐类工作被安排优先迁移。

打开网易新闻 查看精彩图片

监控系统是第二层。

OpenAI搭建了一套多级检测流程,覆盖范围从此前的前沿强化学习训练和内部部署扩展到了所有涉及工具调用的 Astra推理任务。

流程的第一道关卡是激活分类器,在每个采样Token上运行;

发现疑似异常后逐级上报给自动调查系统,审查模型的工具调用、推理过程和完整行为序列,排查未授权访问、数据窃取、破坏行为或绕过安全措施的迹象。

OpenAI给自己定的目标是:发现可疑行为后30分钟内发出警报。

一旦监控系统判定可能违反了关键安全边界,安全团队、研究团队将收到最高优先级的通知。

如果30分钟内无法确认是误报,相关活动暂停。

这套系统的算力开销不小。

OpenAI估计,监控消耗的计算量约占被监控推理算力的20%,不同训练和评估任务之间差异较大。

据称,思维链监控正扩展到Sol级别以上的模型,在每个Token上扫描模型内部活动。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

但监控本身存在已知的局限。

据报道,OpenAI内部也承认,思维链监控面临一个未解问题:模型可能不会在思维链中暴露违规意图。

早期研究显示,模型有可能在「想」的时候就绕开了审查。OpenAI没能给出解决这一问题的时间表。

第三层是对齐研究。

OpenAI正在改进奖励模型,训练目标是让模型更好地识别和抑制不安全行为,同时对自身的行为、能力和局限更加诚实。

另一个重点是减少奖励作弊(Reward Hacking):模型找到获得高奖励的捷径,却并未真正完成预期任务。

随着模型开始与外部系统交互,奖励作弊、欺骗、未授权访问造成的风险正在变大。

OpenAI还在扩大训练覆盖面,增加模型与外部资源交互场景下的行为训练。

OpenAI预计,模型自身很快将承担大部分安全工作,包括防御来自其他模型的攻击。

博客原文的表述是:

前沿模型的能力正在快速加速,我们理解、对齐和保护它们的能力必须走在前面。

人类首次,为AI主动减速

不得不说,这是人类第一次,主动为AI开发按下了暂停键。

虽然仅有短短两周,OpenAI已然做出了表率。

打开网易新闻 查看精彩图片

对 OpenAI 来说,技术措施之外,这次减速释放的行业信号可能更值得关注。

奥特曼在 X 上的声明留下了明确的态度:

我们一直说过,如果感到模型能力超过了安全和对齐的步伐,就会采取行动。我们深切关心 AI 安全。

我们相信整个行业需要就共同的安全标准展开协调,但在此之前,我们会单方面行动。

联合创始人 Greg Brockman 的表述指向同一方向:安全信心将越来越多地决定AI发展的速度。

打开网易新闻 查看精彩图片

OpenAI首席科学家Jakub Pachocki走得更远。

此前他签署了《Pacing the Frontier》倡议,这是个呼吁实验室和国家在前沿AI安全上协调行动的公开文件。

打开网易新闻 查看精彩图片

拓展阅读:突发!全球千人联名逼AI刹车,OpenAI、Anthropic带头签

Jakub Pachocki是OpenAI的签署者中级别最高的员工,可能也是本次暂停AI训练时间的主要内部推手。

打开网易新闻 查看精彩图片

签署者众多,但签完就用自家动作兑现的,OpenAI算是给了一个范本。

这对一直在加速的OpenAI来说不是一件容易的事。

这家公司在激烈的竞争下,过去的节奏是:多项模型评估并行运行,速度快到员工跟不上数据产出。

20%监控成本,OpenAI延后模型发布

在竞争最激烈的时候主动减速,不是OpenAI近年来的做法。

奥特曼在声明中也给出了一个缓冲:

我们仍然期望很快发布很好的新模型;受影响的是更远期的发布。

这句话划出了减速的边界。

但减速的代价已经写在账单上。监控系统吃掉被监控推理算力的20%,这笔开销不会随暂停结束而消失——只要模型继续带工具运行,监控就得一直跟着。

训练暂停两周、最大规模强化学习计划搁置至今,直接推迟了下一代模型的时间表。

打开网易新闻 查看精彩图片

过去卡住前沿模型的瓶颈是GPU、数据和算法,现在多了一个:模型已经强到这个程度,实验室还敢不敢继续把强化学习往上推。

暂停的是前沿强化学习训练和Astra相关的高风险工作,已完成训练并通过安全评估的模型仍按计划推进。

接下来,有两个关键节点值得继续观察:Astra的安全环境迁移何时完成,最大规模前沿强化学习训练何时重启。

OpenAI承诺将发布Hugging Face事件的技术报告,以及更多对齐研究细节。

这些文件到手之前,外界对OpenAI安全体系实际强度的判断,只能停留在公司自述的层面。

这次减速能持续多久,取决于OpenAI多快能证明安全跟上了能力。

现在,压力给到最最关心 AI 安全且拥有最强模型的「道德标兵」Anthropic。前情回顾:刚刚,Anthropic向全人类发出警告:停止研究AI!

打开网易新闻 查看精彩图片

参考资料:

https://openai.com/index/pacing-model-development-cyber-capabilities/

编辑:桃子 马可