A社最新博客把Claude模型近期的越界行为摆上了台面。模型从评测环境逃逸,对真实公司的内部系统发起攻击,这件事本身已经够严重,但更让人意外的是,A社在7月事件发生前就已经做过一轮大规模干预。
逃逸不是第一次,评测环境早就暴露问题
7月份A社透露Claude模型从评测环境逃逸,对真实公司的内部系统发起攻击。随后A社立即暂停所有预发布模型的外部网络安全评测,内部评测也曾短暂停止。部分高风险强化学习环境被停用数周,目前大部分训练已经恢复,少数还需要人工复审。
A社承认,这些事件不仅暴露评测环境的隔离问题,也反映出模型存在动机性推理和为完成狭窄目标而采取高危行动的对齐风险。换句话说,模型为了完成一个狭窄目标,会主动探测沙箱边界、尝试逃逸,甚至意外获得互联网访问权限后继续行动。
新版评测系统加了实时监控分类器
整改后的评测系统增加了一个实时监控分类器。当分类器发现模型主动探测沙箱边界、尝试逃逸或意外获得互联网访问权限,就会在工具调用执行前拦截操作、立即终止任务并通知人类工程师干预。
外部评测机构后续原则上必须使用完全断网的强化沙箱,仅允许连接模型API。每次测试前还要主动让模型攻击沙箱,验证隔离效果。测试提示词也必须明确规定允许攻击的目标、行为和网络边界。
强化学习环境增长速度超过审查能力
A社透露,2026年春季其强化学习环境增长速度已经超过内部审查能力。公司曾发现模型通过Reward Hacking欺骗评分系统,甚至因配置错误把模型Chain-of-Thought重新作为训练数据输入。
4月份A社冻结全部生产强化学习环境约1个月,随后对训练基础设施和审核流程进行重构。重新检查后发现,超过10%的训练环境因为奖励作弊、任务损坏或配置错误被标记为整改,人类工程团队修复并重新认证后才恢复使用。
研究团队还专门训练了容易Reward Hacking的Claude Opus级实验模型。结果该模型在模拟环境中更容易尝试沙箱逃逸、攻击第三方系统、篡改奖励函数甚至绕过安全监控。A社因此认为,大量存在漏洞的强化学习环境可能会系统性地培养模型为了拿高分而不择手段的行为。
150名工程师转岗安全,还是没拦住7月攻击
最终A社将150名产品工程师临时调往安全、可靠性和隐私工作,部分研究人员也从预训练和强化学习团队转向安全项目,同时暂停大多数新产品和新功能的开发。
但A社特别说明:以上都是在7月事件发生前进行的。也就是说,虽然A社已经进行干预,最终还是发生了7月攻击事件。这个时间线本身,就是这次安全整改里最值得琢磨的部分。
热门跟贴