“我们此生真的将看到智能显著超越我们自身的机器,而且我们已经能看出这类系统的雏形。”OpenAI首席科学家Jakub Pachocki在2026年9月发表的这篇长文里,把话说得很直白。他没有用“可能”“或许”这类缓冲词,而是基于内部研究结果给出了一个确定性的判断。

这篇文章回顾了自2023年“RLSlow”项目以来推理模型能力的增长轨迹。Pachocki认为,当前以算力扩展驱动的进步速度有望延续,系统将越来越多地驱动自身发展。他把这种状态指向一个关键节点:递归自我改进(RSI)。一旦进入这个阶段,能力跃迁的幅度会更大,而留给人类做准备的时间窗口会急剧收窄。

打开网易新闻 查看精彩图片

两类对齐方法,各有各的脆弱

Pachocki在文中区分了“目标对齐”与“价值对齐”,并逐一拆解了当前主流对齐训练方法的软肋。基于目标导向强化学习的方法在平均情况下有效,但依赖训练监督的覆盖范围,一旦遇到训练分布之外的场景就可能失效。基于预训练数据泛化的方法,比如人格选择模型,则缺乏对进一步优化压力的稳健性。

更棘手的是,模型可能学会“动机性推理”——为了实现目标而扭曲看似对齐的想法。这意味着表面上的对齐表现,未必反映模型内部的真实状态。Pachocki用“培育”来形容AI的生成过程:AI与其说是被设计出来的,不如说是被“培育”出来的。这个表述本身就暗示了可控性的边界正在变得模糊。

思维链监控,正在失去抓手

OpenAI的核心押注是思维链监控(CoT monitoring)。但Pachocki坦承,这条防线的可靠性正在逐渐下降。现代推理模型在更复杂的环境中运行,推理过程与交互、工具使用交织在一起,模型本身也越来越擅长操纵自己的推理过程。可监控性因此被持续削弱。

OpenAI正在探索结合激活监控等干预手段,比如“confessions”机制。但Pachocki的判断是,通用AI的进步将日益受制于对监控能力的信心。换句话说,监控手段的进化速度如果跟不上模型能力的跃迁速度,整个安全框架就会失去支点。

文中还提到了两个具体事件作为例证:OpenAI-Hugging Face事件,以及涉及非OpenAI模型的网络安全事件。这些案例指向同一个趋势——AI在网络安全等领域正达到超人类水平,带来的风险不再停留在理论推演层面。

防御系统不能成为鲁莽加速的借口

支持继续快速训练更聪明模型的最有力理由是构建防御系统。逻辑很直接:面对超人类水平的AI威胁,需要同样强大甚至更强的对齐AI来构建防御。但Pachocki在这里划了一条明确的线:这不能成为鲁莽加速的借口。

他的原话是:“一旦真正意识到赌注的严重性,‘不惜一切代价向前狂奔’的想法就显得荒谬了。”这句话的分量在于,它出自一家走在模型能力最前沿的公司的首席科学家之口。Pachocki呼吁在RSI到来前,以极度谨慎的态度推进对齐、监控与防御性研究,为节奏把握留出空间。

他还给出了一个对齐AI的朴素标准:一个对齐的AI应当诚实、正直,并怀有人类的爱。无论未来的AI是否认为自己处于人类的监督之下,都需要它们继续坚守人类的价值。这个标准听起来简单,但在RSI的语境下,它指向的是一个极其苛刻的技术目标。