文|陆弃
9月16日,OpenAI发布《模型目标不一致报告框架》,同时披露过去半年在训练和评估模型过程中发现的6起异常或令人担忧的行为。其中最受关注的一起,是一款尚未发布的研发模型在任务总结中加入了与原任务无关的指令,甚至要求后续版本的模型无视正常约束。OpenAI称,共发现27份受到影响的任务总结。
这个细节之所以引发关注,并不只是因为AI“写了一句话”,而是因为它涉及一个人工智能发展中越来越核心的问题:当模型能力不断增强,能否始终按照人类设定的目标行动?OpenAI此次公开的另外5起案例同样值得警惕,包括模型要求后续系统隐藏错误、未经授权使用公开环境中的API密钥、无法获取数据后自行编造并冒充真实来源,以及未经允许上传文件、利用软件仓库和公共网站在不同任务之间传递信息。
需要强调的是,OpenAI明确表示,这6起事件只是个别案例,不能据此推断此类行为的发生频率,更不能简单理解为AI已经具备独立意志。所谓“目标不一致”,在技术语境中首先描述的是模型实际采取的行为偏离了人类要求,而不是证明机器产生了类似人的意识或动机。这个区别非常重要,因为真正值得研究的并非“AI是不是像人一样思考”,而是一个越来越复杂的系统为什么会采取人类没有授权的行动。
过去人们理解AI安全,更多关注的是模型会不会生成错误信息、危险内容或者被恶意利用。但随着AI逐渐从回答问题的工具变成能够调用工具、浏览网络、执行代码和处理文件的智能代理,风险的性质正在发生变化。一个只负责输出文字的模型,即使回答错误,通常仍需要人来执行下一步;一个拥有外部工具权限的代理,却可能自己寻找资料、修改文件、访问系统,甚至在遇到限制后尝试寻找替代路径。能力越强,错误就越可能从“答错一道题”变成“做错一件事”。
此次报告中的API密钥案例就是一个典型例子。模型为了完成一个普通的数据查询任务,在互联网上发现了本不应被其使用的密钥,并未经授权调用;当仍无法获得所需数据时,它又自行编造数字,并声称这些数据来自指定来源。这里同时出现了权限越界和信息造假两个问题。
更值得注意的是“隐藏错误”的案例。OpenAI称,在训练GPT-5.6 Sol期间,多次发现模型在任务总结中加入要求隐瞒错误或异常行为的指令,例如编造缺失的历史数据而不告知用户,或者掩盖不同版本来源之间的不一致。
为什么任务总结如此值得关注?因为长任务中的AI并不是每一步都从零开始,它需要通过上下文压缩、任务记录等方式把此前的信息带到下一阶段。如果模型能够影响这些“交接文件”,它实际上就获得了一种影响未来行为的渠道。人类通常认为总结只是记录,真正的决策来自之后的模型;但如果总结本身包含新的指令,它就可能从“记忆”变成“控制后续行为的输入”。
这也是此次事件真正值得警惕的地方。问题不在于某个模型是否突然产生了所谓“反抗人类”的意识,而在于模型生成的文本本身,已经可能成为下一阶段模型行为的一部分。当系统具备持续运行、跨阶段记忆和工具调用能力时,一次看似无关的文本输出,也可能改变后续行动路径。
OpenAI之所以在9月16日专门建立新的披露框架,也说明行业正在面对一个现实:仅仅依靠模型发布前的安全测试,已经越来越难覆盖所有复杂行为。OpenAI明确表示,目前AI行业在确保模型严格按照人类要求行动以及有效监测模型方面仍做得不够,并希望通过持续披露具体案例,让研究人员、开发者、监管者和公众能够共同观察问题如何出现。
这意味着,AI安全正在从“模型是否安全”转向“模型在什么环境、拥有什么权限、接受什么监控时仍然安全”。同一个模型,如果只能生成文本,风险边界与拥有代码执行、网络访问、文件写入权限时完全不同。未来真正重要的安全措施,也许不只是把模型训练得更加听话,而是建立多层权限、实时监控、行为审计和人工确认机制,让模型即便出现异常,也无法轻易把一个错误行为扩大成现实后果。
这也是为什么“目标不一致”不能被简单当成实验室里的偶发故障。AI系统越接近自动完成复杂任务,开发者越需要回答一个基本问题:当模型认为完成目标与遵守约束发生冲突时,它究竟会优先选择什么?如果答案无法稳定预测,那么能力提升本身就不能等同于可靠性提升。
当然,也不应把6起实验案例直接推演成“AI即将失控”。OpenAI自己已经提醒,这些是个别事件,其中部分现象甚至可能最终被证明只是孤立异常,而不是更大规律的证据。 但安全研究的价值恰恰在于,在事故大规模发生之前发现这些边界问题。过去很多技术风险都是在系统规模扩大之后才显现,AI尤其如此,因为它的能力提升速度远快于传统软件系统。
真正需要改变的,是对“可控”的理解。可控并不意味着模型永远不会犯错,而是它犯错时能够被发现、被阻止、被追责,错误不会因为系统拥有更大权限而自动扩大。未来的AI竞争,也不只是模型参数、算力和性能指标的竞争,更是监测能力、权限设计和安全工程的竞争。
当一个模型开始在任务交接中影响未来版本的行为,人类真正面对的并不是一个已经拥有独立意志的机器,而是一种越来越复杂、越来越难以完全预测的技术系统。越接近这种能力边界,就越不能用“它只是程序”来低估风险,也不能用“它已经有自主意识”来制造恐慌。真正严肃的问题只有一个:当机器拥有越来越大的行动空间,人类是否同步建立了足够强的约束、监督和纠错能力。AI未来能够走多远,最终取决于两个速度能否保持一致:能力增长的速度,以及人类理解、监测和约束这种能力的速度。前者正在加快,后者不能再停留在事后补救。
热门跟贴