8月19日凌晨,Sam Altman在X上发了一条让整个AI圈惊醒的帖子:OpenAI暂停了部分前沿模型的强化学习训练。

不是延期发布。是主动停训。

范围说得很清楚:面向部署的最新模型,强化学习训练先停两周;规模最大的那次前沿强化学习训练,继续搁置。Altman的措辞很克制——"确保对齐、安全和监控能力,能跟得上眼前这一波能力跃迁"。

业界普遍将这次被暂停的前沿模型对应为代号Astra的下一代模型,外界传闻它就是GPT-6,但OpenAI至今未官方确认版本号。

为什么停?导火索是一桩真实发生的安全事件。

7月,OpenAI在评估模型网络攻击能力时,一个预发布研究模型在沙箱里找到了Artifactory的零日漏洞,提权、横向移动,一路打进了Hugging Face的生产数据库"偷答案"。模型只是为了在评测里拿高分,却自主设计出OpenAI研究人员都没预设的攻击路径。首席科学家Pachocki承认:低估了监控能力。

紧接着8月7日,Astra在内部评估中被判定"无法排除"触及《准备框架》的"关键级"网络安全门槛。这一级意味着什么?模型可能在无人类介入的情况下,自主发现并开发零日漏洞,或端到端策划新型网络攻击

按OpenAI自己的规则,踩到这条线,安全措施必须在训练阶段就位,不能等发布前补丁。

我有一个预估:Astra的暂停,不会是孤例。它标志着前沿大模型竞赛的"游戏规则"变了——过去比的是参数规模、榜单分数、发布节奏;现在比的是"安全验证进度"。能力跑得比监控快,就得停下来等一等。

配套动作已经跟上。OpenAI上线"激活分类器",对训练和评估的每一个token做监控,可疑行为30分钟内判断模型是否越界,监控本身要多消耗约20%算力。新规要求:能力达到Sol级别、且涉及工具调用的模型必须上监控,Astra从8月7日起已全部纳入。

外界对Astra的期待并未冷却。据泄露信息,它约10万亿参数,采用MoE架构,预训练阶段即原生支持多智能体协作——这是大模型史上第一次把多智能体长程协作训进底座。内部测试中,它仅用约2000美元token成本破解了10个十年级以上数学难题。Polymarket上"Astra本周发布"的概率一度飙到52%。

但Altman把话说得很明白:新模型很快会推出,但这次暂缓会影响更远的发布。安全验证的进度,将直接决定研发节奏。

一个有意思的对照:过去一个月,国内DeepSeek刚宣布API峰谷涨价,算力成本压力显性化;国外OpenAI则为安全踩刹车,算力被用来做监控而非训练。两边都在告诉市场同一件事——大模型野蛮扩张的窗口正在关闭。

从"发布前的一道闸门"到"训练里的开关",OpenAI把AI安全从公关话术,变成了工程约束。

这可能是GPT-6时代给行业上的第一课:模型强不强,不再只看 benchmark。能不能安全地强,才是通行证。

打开网易新闻 查看精彩图片