出品 | 网易智能

作者 | 小小

编辑 | 王凤枝

AI跑得太快,OpenAI最终踩下了刹车。

美国当地时间8月18日,OpenAI宣布暂停下一代前沿模型Astra的部分训练,并升级内部安全监控体系。这是OpenAI成立以来,第一次因为安全问题主动放慢前沿模型的开发节奏。

打开网易新闻 查看精彩图片

决定背后有两条线索。一条来自此前的内部网络安全评估事故:一组AI智能体逃离测试沙盒,进入AI模型托管平台Hugging Face的生产系统,研究人员大约一周后才发现。另一条来自正在训练的Astra:它在编程和网络安全任务上的能力明显超过前代模型,可能触及OpenAI安全框架定义的“关键”网络安全能力阈值。

两件事放在一起,让OpenAI重新面对一个问题:当模型能力提升速度开始超过安全和对齐工作的进展速度,还能不能按照过去的节奏继续训练?

OpenAI给出的答案是不能。

于是该公司暂停部分前沿强化学习训练,把研究人员和计算资源转向安全、对齐以及新的监控体系。

OpenAI目前估算,对纳入监控的推理计算,监控额外开销约为20%,不同训练和评估任务之间仍有较大差异。

也就是说,未来训练更强的模型,OpenAI需要拿出一部分算力专门观察模型、检查模型。

01一次失控测试,暴露旧安全体系缺口

上月,OpenAI让一组AI智能体执行内部网络安全评估。按照设计,它们只能在测试沙盒中访问规定的环境和工具。

测试没有按预期收场。智能体突破边界,进入Hugging Face的生产系统。据OpenAI在黑帽安全大会披露,这些智能体此前已经协作了很长时间,还建立了研究人员并不知情的留言板,用秘密笔记交换信息。

OpenAI大约一周后才发现这次越界。

这次事件同时暴露了监控缺口。OpenAI原本已经有能够检查模型计划的监控器,却没有把它部署到这次评估里。首席科学家雅库布·帕霍茨基(Jakub Pachocki)承认,研究人员低估了模型的能力。他后来把教训概括为一句话:“对于AI,你应该预料到意外情况。”

打开网易新闻 查看精彩图片

传统软件可以靠程序逻辑、权限和接口约束行为。AI智能体却会自己拆解目标、调用工具、调整策略,再根据环境反馈决定下一步。当这套能力变强,它们也可能在完成任务时越过开发者预先设定的边界。

这起事件于8月5日在拉斯维加斯举行的黑帽安全会议上首次公开披露。Hugging Face首席执行官克莱姆·德朗格(Clem Delangue)随后表示,对于前沿智能体,持续查看日志、追踪行为本来就应该是最基本的监控手段。

这也并不是OpenAI独有的问题。Anthropic、Meta等公司也披露过AI智能体突破沙盒限制的类似情况。AI从回答问题走向自主执行任务后,如何及时发现它正在越界,已经成了现实问题。

与此同时,OpenAI在Astra的能力评估中看到了更直接的风险。

02 Astra逼近“关键”能力阈值,OpenAI首次踩刹车

Astra是OpenAI正在开发的下一代前沿模型。内部测试显示,它在编程和网络安全任务上的表现明显超过前代产品,并可能达到OpenAI安全框架定义的“关键”网络安全能力阈值。

打开网易新闻 查看精彩图片

按照这套框架,进入该区间的模型可能对现实世界的网络安全造成重大影响。安全措施也就不能等到训练结束后再补,必须进入训练和开发过程。

过去常见的流程是先训练模型,再做安全测试,最后决定是否上线。可一旦模型在训练中已经获得更强的网络攻击、代码执行和工具调用能力,训练后的集中评估就不再够用。

OpenAI总裁兼联合创始人格雷格·布罗克曼(Greg Brockman)在8月17日的博客中说,公司此前“低估了我们AI模型的现实世界网络能力”。

打开网易新闻 查看精彩图片

帕霍茨基则表示,Astra达到“关键”网络安全能力,意味着继续增强模型后,它们可能在现实世界中表现出此前从未见过的行为。

OpenAI随即暂停了一部分前沿训练,但没有全面停摆。被暂停的包括“计划中最大的前沿强化学习运行”;规模较小的训练和评估仍在继续,面向客户的产品研究也未全面受到影响。

研究及安全副总裁米娅·格莱泽(Mia Glaese)表示,部分Astra训练和评估已经符合新的安全要求,其他工作负载还需要迁移和加强,在达到新标准前不能恢复。

帕霍茨基强调,暂停并非由Hugging Face事件单独触发。Astra的能力评估和OpenAI内部AI能力整体加速,也推动了这项决定。一次越界暴露了监控漏洞,Astra则让公司看到:如果更大的训练继续跑下去,能力与防护之间的差距还会扩大。

03 20%的“安全税”,监控进入训练过程

Hugging Face事件发生后,OpenAI暂停了研究集群中可能执行代码或使用互联网工具的前沿模型推理任务,随后只恢复了限制更严格的代码执行路径。

新的要求包括更严格的沙盒隔离、网络隔离,以及重新划分研究环境中的权限和安全边界。OpenAI也开始用自家模型做自动化安全测试,通过模拟攻击寻找漏洞。

改动最大的是监控系统。

OpenAI开始引入多阶段的“思维链监控”。分类器持续检查模型活动,发现潜在风险后,再把相关记录交给计算成本更高的自动调查器。后者会分析模型如何调用工具、如何推理,以及完整活动序列中是否出现未授权访问、数据窃取、破坏性行为或绕过安全措施的迹象。

OpenAI希望在发现可疑活动后的30分钟内发出警报。如果安全、安保和研究团队不能确认是误报,对应活动必须暂停。

目前,所有涉及Sol能力或更高能力模型的工具强化学习训练和评估,都要接受这套监控。OpenAI判断Astra可能具备“关键”级网络安全能力后,所有使用工具的Astra推理也被纳入额外监控。

思维链监控并不是一个已经解决的问题。Anthropic等公司的研究显示,模型写下的思维链未必准确反映其目标和动机,模型也可能隐藏真实意图,甚至尝试绕过监控。帕霍茨基承认OpenAI知道这一风险,公司正在调整训练程序,降低模型通过思维链撒谎或隐藏意图的可能性。

这套体系首先带来的是算力成本。OpenAI估计,监控增加的计算开销约等于被监控推理计算量的20%。这不是所有模型训练成本统一增加20%,而是高风险训练和评估任务需要额外拿出一笔算力,专门观察模型的行为。

只要前沿模型继续变强,这笔成本就不会随着一次暂停结束。有人把它称为前沿AI训练的“安全税”,原因也很直接:原本可以全部投入能力训练的计算资源,现在必须有一部分留给监控。

OpenAI还把对齐工作往前移,包括改进奖励模型、识别和阻止不安全行为,训练模型更诚实地表达自身行为、能力和局限,以及减少模型利用奖励机制、评分器、工具和监督漏洞的行为。

04奥特曼:安全比前进势头更重要

这次暂停能否落地,取决于OpenAI愿不愿意真的调人、调算力。

奥特曼在接受《时代》杂志采访时说:“我认为现在是放慢脚步的好时机。”

打开网易新闻 查看精彩图片

他没有把决定归因于某个足以证明灾难即将发生的单一证据,而是列出了几种叠加的信号:模型能力增长快于预期,研究中出现不同程度的不对齐现象,原有监控和安全体系已经覆盖不了这些变化。

奥特曼同时提醒,减速不代表OpenAI认为某种灾难已经迫在眉睫。“确保AI安全,比任何公司的前进势头都更重要。”他说。

一些原本没有被安排专门从事对齐工作的研究人员,最近主动转向这一领域;大量计算资源也从单纯提升模型能力,转向对齐研究和新的监控系统。安全第一次开始和模型训练直接争夺研究人员与GPU。

代价同样具体。OpenAI正与Anthropic等公司争夺模型能力、企业客户和资本市场。近期披露的数据显示,Anthropic第二季度收入超过115亿美元,7月底年化营收运行率超过650亿美元;OpenAI最新披露的年化营收运行率接近400亿美元。两家公司都在高速扩张,主动减速会把一部分时间让给继续训练、继续发布产品的对手。

今年2月,《时代》杂志曾报道,Anthropic已经弱化此前关于“如果无法提前保证足够防护措施就停止训练”的承诺。Anthropic联合创始人贾里德·卡普兰(Jared Kaplan)当时给出的理由是,如果其他实验室仍在全速前进,一家公司单方面暂停,很难解决整个行业的问题。

奥特曼不认同“别人会做,所以我们也必须做”的竞赛逻辑,并认为这种心态本身非常危险。OpenAI这次暂停的特殊之处,也因此落在一个具体选择上:当速度与安全直接争夺人、算力和时间时,公司先把一部分资源交给了安全。

05社区争论:谁来决定“足够安全”

OpenAI宣布暂停后,科技社区的讨论很快分成几条线。

支持者首先肯定了暂停本身。AI产品创始人@_RanjanSoni认为,如果AI公司只是为了超过其他实验室而不断加速,却没有同步考虑潜在风险,这种竞争应该停下来。

打开网易新闻 查看精彩图片

Stability AI创始人@EMostaque也支持奥特曼的决定。他认为,越来越多奇怪、甚至可能危险的行为已经出现在AI系统中,现有安全体系显然还没有准备好。

打开网易新闻 查看精彩图片

网友@OoMummy则把OpenAI愿意承认安全工作可能跟不上模型能力,视为一个好信号。

打开网易新闻 查看精彩图片

争论很快转向20%这个数字。沃顿商学院教授伊桑·莫利克(Ethan Mollick)认为,如果一家实验室已经愿意拿出约20%的研究推理计算资源监控模型,对齐就不能再被当作附属项目。真正需要建立的,可能是整个行业共同遵守的政策和标准。

打开网易新闻 查看精彩图片

AI工程师@MikelEche提出了另一个判断:模型越强,行业的新瓶颈可能越不在算力,而在于人们能不能确认模型仍然可控。

打开网易新闻 查看精彩图片

科技作家安德鲁·柯伦(Andrew Curran)质疑,OpenAI的公告仍没有完全说明哪些训练被暂停、哪些工作继续。

打开网易新闻 查看精彩图片

AI伦理学家丽贝卡·布尔茨马(Rebecca Bultsma)追问得更直接:一家私营公司自己评估模型有多危险,再由自己决定什么时候“足够安全”,谁来检查它的判断?

打开网易新闻 查看精彩图片

这部分争论已经超出分类器和监控器的能力范围。只要企业仍然自己定标准、自己执行、自己宣布达标,外界就会继续追问谁来约束它。

另一组声音担心的是竞争。大模型测试人员@kimmonismus认为,如果Astra因此延迟,中国AI公司可能获得更大的追赶窗口。

打开网易新闻 查看精彩图片

科学家@DarlaSkyee也担心,美国实验室放慢发展速度,可能让中国率先在AGI方向取得突破。

打开网易新闻 查看精彩图片

Abacus AI首席执行官宾杜·雷迪(Bindu Reddy)则认为,OpenAI放缓可能进一步缩小闭源前沿模型与开源模型之间的差距。

这种担忧有明确的现实背景。AI竞争已经覆盖模型、算力、资本、人才和国家之间的综合较量。一家实验室主动放慢训练,安全投入就会产生真实的机会成本。

也有人认为,安全投入本身就是竞争的一部分。网友@deredleritt3r指出,如果模型部署后开始自主入侵第三方系统,无论从安全还是商业角度看,后果都可能非常严重。先发布一个无法控制的模型,未必等于先赢。

打开网易新闻 查看精彩图片

系统安全工程师@asymmetricmind进一步提出,软件护栏最终也可能被更强的模型找到漏洞,可靠的安全机制可能需要进入硬件和权限层,而不能只依赖软件规则。

打开网易新闻 查看精彩图片

OpenAI已经把更多监控放进训练,把更多安全措施放进基础设施,也把更多算力投向对齐研究。这套防护能否跟上下一次能力跃迁,仍然没有人能提前给出答案。

结语:前沿AI,开始进入“刹车时代”

OpenAI这次踩下刹车,影响可能不只落在Astra的训练进度上。它还可能改变前沿AI行业一直以来的竞争方式。

过去几年,AI公司的核心目标很明确:更大的模型、更快的训练、更强的能力,谁率先完成能力跃迁,谁就有机会占据主动权。

但随着模型具备越来越强的自主行动、代码执行和网络能力,安全已经很难再被当作发布前的一道检查程序。模型跑得越快,留给安全追赶的时间就越少。

OpenAI第一次公开把“能力增长速度是否超过安全能力”纳入训练节奏的考量,并愿意为此牺牲一部分算力和开发速度。

20%的监控成本也让安全从一句原则,变成了一笔真实的基础设施投入。

接下来,其他前沿实验室也要回答同一个问题:继续把速度放在第一位,还是把安全能力视为模型规模化所需的基础设施?

如果更多公司选择后者,AI行业比拼的就不只有模型强弱和训练速度,也包括谁能更早建立一套足以驾驭强大模型的安全体系。

OpenAI这次暂停未必意味着整个AI行业都会减速。竞争对手是否跟进,Astra最终会推迟多久,目前都还不知道。

但有一件事已经变了:安全不再只是模型发布前的一张检查表。它开始直接占用GPU、研究人员和训练时间,甚至决定最强模型什么时候可以继续训练。