9月3日,OpenAI正式发布GPT-6 Astra。
如果只看发布页,这很容易被理解成又一次模型能力刷新:更强的编程、更好的计算机操作、更复杂的研究任务,以及更完整的多步骤工作能力。
但Astra这次有一个此前OpenAI模型没有出现过的标签:
Critical。
按照OpenAI自己的Preparedness Framework,GPT-6 Astra成为其首个达到“Critical cybersecurity capability”级别的模型。
这个变化的重要性,可能比又刷新了几个Benchmark更大。
因为它意味着,前沿模型开始进入这样一个阶段:
模型已经训练出来,不代表它马上就适合被发布。
“Critical”到底意味着什么
这里首先要避免一个误解。
“Critical”不是整个AI行业统一认可的能力等级,而是OpenAI自己Preparedness Framework中的风险分类。
按照OpenAI给出的定义,在配备适当工具和访问权限的条件下,达到这一等级的模型,可能具备在防护较强的真实系统中发现此前未知安全问题,并进一步形成利用路径的能力,而且不再需要人类逐步指导。GPT-6 Astra是OpenAI首次正式认定达到这一等级的模型。
这和过去常见的“AI可以帮助写代码”“AI可以辅助网络安全分析”,已经不是同一个风险量级。
能力提高有明显的双重用途。
安全团队可以用更强的模型寻找漏洞、检查代码和加快防御;同一套能力如果被滥用,也可能降低攻击复杂系统的门槛。
所以Astra发布时,OpenAI没有把全部高级网络安全能力直接无差别开放。部分更高级的安全能力会先限制在较小范围内,再通过专门的防御性使用渠道逐步扩大。
OpenAI真的因为安全问题踩过刹车
这次另一个很少见的信号,是OpenAI公开承认:
为了准备Astra,公司确实放慢过研发和发布。
8月,在内部评估发现Astra可能达到Critical网络安全能力之后,OpenAI曾暂停部分强化学习训练约两周,用来强化训练环境的隔离、网络控制和监控系统。部分没有达到新安全标准的工作负载继续暂停,直到迁移到更严格的环境。
到9月1日,OpenAI进一步确认,过去几周Astra的部分开发和发布工作都曾被推迟,用于强化针对网络滥用和模型未经授权行动的防护。
这件事值得单独拿出来看。
过去观察模型公司的节奏,大家通常盯着几件事:
训练有没有完成,Benchmark有没有提高,推理成本有没有降下来,竞争对手是不是马上也要发布。
Astra之后,至少还需要增加一个变量:
模型公司的安全基础设施,能不能跟上模型能力。
如果跟不上,模型能力跑到前面,产品发布时间也可能被迫往后推。
一个模型,现在可能需要两套“进度条”
OpenAI为Astra增加的措施已经不只是传统意义上的内容审核。
官方披露的防护包括更严格的内部环境隔离、模型checkpoint加密、针对完整Agent执行轨迹的监控,以及在内部使用前必须通过的对齐评估。
在外部部署中,系统还会持续检查模型的推理和行动。一旦判断可能出现未经授权的行为,可以触发警报,甚至暂停或终止任务。
这些措施并非没有代价。
OpenAI此前估计,对相关推理过程进行监控,额外计算开销大约可达到被监控推理算力的20%,不同工作负载会有所差异。与此同时,OpenAI也明确提醒,额外安全检查有可能误判正常任务,让合法工作被减速、暂停甚至停止。
这就出现了一个过去不太明显的工程问题。
未来训练一个前沿模型,实际上可能同时存在两条进度线:
一条是能力进度线。
模型能不能完成更复杂的代码、研究和Agent任务。
另一条是部署进度线。
公司能不能证明它可以在真实产品环境中被监控、限制和及时停止。
第一条完成,不代表第二条同步完成。
而只有两条都走到足够远,模型才真正具备大规模上线的条件。
更强的模型,也开始变得更难监控
事情还有另一面。
GPT-6 Astra虽然在多项对齐测试中表现得比GPT-5.6 Sol更好,OpenAI却同时披露了一个并不轻松的结果:
Astra的书面推理比GPT-5.6 Sol更难监控。
在专门要求模型尝试规避监控的测试中,Astra在部分简单任务上表现出了更强的推理控制能力,并且能够用更少的显式步骤完成问题。对于复杂任务,它还不能稳定隐藏必要的推理过程,但OpenAI认为这种下降值得认真对待。
这会让前沿AI出现一个有些矛盾的趋势:
模型越聪明,一方面可能越懂得遵守规则;另一方面,它也可能越来越擅长控制自己向监控系统暴露什么。
路透社在Astra发布后的报道中,同样把“模型能力提升”和“人类监督难度增加”放在了一起。OpenAI首席科学家Jakub Pachocki也表示,模型能力越来越强之后,准确理解它到底能做什么正在变得更加困难。
这不是一句“加强安全”就能解决的问题。
因为用于监督AI的工具,也必须跟着AI本身一起升级。
Astra真正改变的,可能是前沿模型的发布规则
GPT-6 Astra目前仍在分阶段开放。
OpenAI 9月3日的发布说明显示,首批只有有限组织获得访问权限,更广泛的ChatGPT和API开放会在随后逐步推进。
这种节奏本身并不罕见。
真正不同的是,这一次OpenAI已经把“能力是否达到Critical”“训练环境是否足够安全”“监控系统能否发现异常”“哪些能力应该限制开放”正式放到了发布决策里。
这让前沿模型竞争多出了一个此前存在感没有那么强的维度。
以后评价一家AI公司,可能不能只看:
谁的模型分数最高,
谁价格最低,
谁上线最快。
还需要看:
谁有能力把越来越强的模型安全地训练出来,并且真正放到现实世界里运行。
Astra只是第一个被OpenAI标记为Critical的模型。
按照前沿模型目前的演进速度,它大概率不会是最后一个。
到那时,真正限制下一代模型发布速度的因素,可能不再只是GPU、数据和训练算法。
也可能包括另一件事:
人类是否已经准备好了足够可靠的控制系统。
资料来源:OpenAI《GPT-6 Astra: A new generation of intelligence》《Safety overview: GPT-6 Astra》《Path to Astra: critical capabilities and frontier safeguards》《Pacing model development in an era of cyber-critical capabilities》;Reuters
原创声明:本文为「AI观察范」原创内容,未经授权请勿转载或摘编。
热门跟贴