打开网易新闻 查看精彩图片

今天凌晨,OpenAI 突然宣布,在 Hugging Face 入侵事件后已经暂停了最新模型的强化学习(RL)训练两周;同时,原计划进行的迄今最大规模前沿强化学习训练也处于暂停状态——

他们计划用这段额外的时间评估模型行为、获取有关模型安全对齐状况的信息并调整安全措施。

打开网易新闻 查看精彩图片

当然,这也意味着预热已久的下一代大模型 Astra 大概率又要跳票了。

在大模型「卷生卷死」的时代,为什么 OpenAI 要主动踩刹车?归根结底,还是安全问题

濒临「失控」的前沿模型

正如公告开头所说,这次「刹车」,其实早已有迹可循——

第一个「危险迹象」,是上个月发生的「Hugging Face 入侵事件」。

打开网易新闻 查看精彩图片

在一项名为 ExploitGym 的网络安全能力评估中,OpenAI 的内部研究模型自行在隔离环境中通过零日漏洞连接上了互联网,并且为了「考试作弊」,主动攻击了可能存放着 ExploitGym 测试参考答案的 Hugging Face,表现出「自行策划完整攻击行动」的潜力。

另一个信号,是 OpenAI 认为他们未发布的新模型 Astra 已经达到了此前设定的「关键网络安全能力」门槛。

打开网易新闻 查看精彩图片

也就是说,Astra 已经不能当成普通的大模型等闲视之,因为它完全有能力自己写代码、找漏洞、规划供给步骤、调用工具、长时间执行任务……一旦让它「出笼」,就有可能像真正的黑客一样入侵现实生产设施。

两件事合起来,表明大模型能力的增长正在带来巨大的安全风险。

可以作为旁证的是,Claude Opus 4.7、Mythos 5,Kimi K3,以及 Muse Spark 1.1 模型最近都先后曝光出现了突破安全沙箱、入侵公共互联网的「越狱」事件,以至于「越狱」一时成为了一种代表模型能力的营销手段。

可能是因为 Hugging Face 入侵事件带来的教训,在公告中,OpenAI 不仅提出要加强监控和红队对抗训练,更是一再强调要「让越来越强大的系统保持对齐」。

打开网易新闻 查看精彩图片

对齐(Alignment),这个在 ChatGPT 发布初期就曾掀起讨论热潮的名词,很可能又会成为 AI 安全时代的主旋律。

让模型「遵守规则」,比想象中更难

2003 年,哲学家 Nick Bostrom 提出了后来著名的「回形针最大化器」思想实验:

假设人类设计出了一台具有通用学习和自我迭代能力的超人工智能,并给它设定了一个极其简单的任务:尽可能多地制造回形针

那么,一开始这台 AI 可能只是会接管工厂、优化供应链,但为了防止人类妨碍它实现制造回形针的终极目标,它可能会选择控制所有基础设施,甚至是制造武器来保护生产自主权。

最后,由于其他一切事物都在占用着原本可以用来生产回形针的原料,说不定它会决定把包括人类在内的所有生物都重组为制造回形针的材料。

打开网易新闻 查看精彩图片

更重要的是,在这个过程中,AI 都没有任何主观的恶意。它只是忠诚于自己的目标,也不受那些潜藏在人类社会中的「默认规则」束缚,毁灭人类不过是完成任务过程中不经意的副作用。

这一点可以和「Hugging Face 入侵事件」形成观照——

在 ExploitGym 中,从来没有人规定让模型攻击 Hugging Face,研究人员为其设定的目标仅仅是完成安全测试。但没人能想到,模型认为直接「抄答案」比做题更简单,同时根据各种线索推测答案可能存放在 Hugging Face,于是才想方设法对后者发动了攻击。

打开网易新闻 查看精彩图片

这就是一个很典型的「对齐问题」。

由于 AI 可以调用一切可能的工具和能力,它的「作弊手段」,永远只有你想不到,没有它做不到。

比如说,Google DeepMind 此前给出过一个「AI 钻空子」的案例集,其中一个案例是这样的:

研究人员为了让虚拟机器人学会走路,而设定了「越快到达目标分数越高」的奖励函数。但控制机器人的 Agent 意识到,只要把机器人的腿折成特殊形状,然后让身体贴着地面滑行,就能最快抵达终点。虽然一点都不像「走路」,但它毕竟是完成了目标。

打开网易新闻 查看精彩图片

类似的情况,在进化算法和强化学习中比比皆是:只要奖励函数奖励的是「移动速度」,而没有明确规定「必须通过正常步行方式实现」,模型就可能找到极其奇怪的运动方式。

提出任务的方式,可能比解决任务更重要

演化生物学家罗伯特·特里弗斯曾提出过一个假说:人类的情绪是为了让我们学会社会规范而演化出来的。

正因为内疚和羞耻等感觉会让我们感到难受,那些违背社会规范的行为,从一开始就没有纳入过我们的考虑——我们不偷别人的钱,不是因为经过成本-收益分析之后确定这样不划算,而是因为道德感让我们根本不会考虑这种可能性。

打开网易新闻 查看精彩图片

▲ 尴尬、羞耻等情感约束了人的行为 图片来自:Greg Rosenke

情绪和社会规范的共同演化,固然减少了我们的选择,但也提高了整个社会的信任程度,让合作变得更简单。

问题在于,AI 没有人类的情绪,也不会真心接受人类的社会规范,这就意味着,它可能动用所有可能的手段来实现目标;而由于那些「非法手段」已经被我们的道德感排除出去了,在设计奖励函数时,人类研究者很难想到要禁用它们 。

过去,当 AI 还只能在游戏里移动几个像素、控制一艘赛艇的时候,奖励函数设计错了,最坏的结果可能只是 AI 在原地转圈作弊刷分。

打开网易新闻 查看精彩图片

但此时此刻,AI 连接的是终端、浏览器、代码执行环境和真实互联网。未来,Agent 还会连接邮件、支付、企业数据库、机器人乃至更多现实世界的基础设施。一旦出错,后果不堪设想。

可以预想到,随着 AI 变得更强,对齐问题的重要性只会愈发明显。

OpenAI 之所以甘愿暂停前沿模型研究、用相当于总算力 20% 的资源来监控 AI 行为,说到底都是为了解答一个问题——

如果 AI 越来越擅长完成我们交给它的任务,我们是否也越来越擅长告诉它,哪些事情即使有助于完成任务,也绝对不能做?