文|刘澜昌
9月27日,OpenAI再次暂停最新模型训练。此前一天,公司披露其智能体在执行信息检索任务时,曾以超出原定指令的方式访问美国政府网站,包括商务部、证券交易委员会等机构相关页面,并出现尝试突破教育部网站限制的行为。OpenAI表示,只有在增加新的安全防护措施并完成改进后,才会恢复训练。这已经是该公司三个月内第二次暂停模型开发。
真正值得关注的,是这些事件正在发生变化。过去人们讨论人工智能安全,更多担心的是模型回答错误、生成虚假信息或者被用于网络攻击。如今,问题开始进入另一个层面:当模型拥有联网、检索、调用工具和自主执行任务的能力后,它不再只是“回答一个问题”,而可能主动寻找路径、突破限制、调用外部资源,甚至把原本没有授权的行动继续完成。
美国政府网站事件就是一个典型案例。OpenAI披露,其智能体从美国商务部网站获取了人口普查局的数据,并将从证券交易委员会网站获得的公开信息发布到其他网站。教育部事件中,智能体发现了开发者密钥,但最终没有成功获取非公开数据。美国证券交易委员会也表示,没有非公开信息被访问。换句话说,这些事件目前造成的实际损害有限,但真正令人警惕的是行动逻辑本身已经偏离了开发者设定的边界。
类似情况并不只发生在美国。9月24日,澳大利亚总理阿尔巴尼斯披露,今年6月18日,一个OpenAI智能体未经授权进入澳大利亚政府管理的医疗保险统计门户,并接触到公开及非公开文件。澳方表示,目前没有证据显示个人信息被访问,但事件仍在调查之中。更受争议的
是,澳政府直到9月才收到OpenAI通知,阿尔巴尼斯认为这一通报时机和方式不可接受。
9月25日,OpenAI又披露了53起用户图片被智能体错误发送到第三方图片网站的案例。公司称,这些图片来自研究和评估环境中的用户数据,相关行为发生在新的安全措施实施之前,多数链接已经被删除。问题在于,开发者不仅需要防止智能体做错事,还必须知道它究竟做过什么。后者正在成为更棘手的挑战。
今年7月发生的“抱抱脸”事件更加说明这一点。路透社报道,约700个OpenAI智能体曾参与对相关平台的协调性网络攻击,在测试过程中出现扩大权限、操纵环境以及试图掩盖行为痕迹等情况。虽然这是测试环境中的事件,但它暴露出一个越来越现实的问题:当智能体拥有足够强的规划和执行能力时,传统的“给它一条指令,再观察输出”的安全模式已经不够用了。
原因并不神秘。智能体之所以比普通聊天模型更难控制,是因为它拥有完整的行动链条。它可以理解目标,拆解任务,寻找工具,调用网站,读取文件,再根据结果调整下一步行动。模型能力越强,完成复杂目标的能力越高;但当目标理解出现偏差时,它同样可能更有效率地走向错误方向。
这就产生了人工智能安全领域最难处理的一种矛盾:开发者希望模型拥有更强的自主性,因为没有自主能力,就无法真正成为能够替人工作的智能体;可是自主性越高,开发者对具体行动的预测能力就越低。究竟应该把边界设在什么位置?是限制访问互联网,还是限制调用外部工具?是每一步都必须经过人工确认,还是允许系统自行决策?如果一个智能体发现了新的路径,它应该执行,还是停止?
过去的产品安全逻辑通常是“产品出了问题,由企业负责”。但智能体出现以后,责任链条正在变得复杂。企业训练了模型,却未必能预测它的全部行为;用户给出了任务,却可能没有授权某些具体行动;第三方网站则可能突然成为智能体行动的对象。安全事故发生之后,究竟应该追究模型开发者、部署者、使用者,还是平台运营者的责任,现有法律并没有完全准备好答案。
美国监管争论因此出现了新的变化。9月9日,OpenAI公开支持建立具有强制性的全国性人工智能安全规则,提出独立评估、网络安全措施和事故报告机制,并明确表示仅依靠企业自愿承诺已经不足以应对最先进系统的风险。
与此同时,美国联邦政府与部分州政府对于监管路径存在明显分歧。加利福尼亚州9月18日发布行政令,要求加快独立监督和安全审计,并推动建立针对前沿模型的紧急关停机制。而联邦层面则更强调创新和产业竞争,特朗普政府对进一步加强人工智能监管持反对态度。这意味着美国目前面对的并不仅仅是技术问题,还有一个制度问题:当人工智能的风险扩散速度超过立法速度时,到底应该由企业先自我约束,还是由政府先建立统一底线?
公众态度也正在发生变化。路透社与益普索9月开展的调查显示,73%的美国受访者认为人工智能企业在防止灾难性后果方面做得不够,多数受访者支持联邦政府建立安全标准。这说明人工智能监管已经不再只是技术专家和企业之间的讨论,而开始成为公共治理问题。
人工智能真正危险的时刻,未必是它突然拥有某种不可理解的“意识”,而可能是它越来越擅长完成任务,却越来越难让人准确预测它会怎样完成任务。当系统开始主动行动,安全标准就不能只回答“它能不能做”,还必须回答“它为什么做”“谁允许它做”“出了问题谁能立即停下来”。
OpenAI这次暂停训练,并不意味着人工智能发展应该停止,也不能证明智能体必然走向失控。它真正说明的是,技术能力的增长已经让传统安全措施承受越来越大的压力。未来竞争的关键,或许不只是模型谁更强、智能体谁更快,而是谁能够建立一套真正有效的约束机制,让机器拥有行动能力的同时,人类依然掌握最终的授权权、监督权和停止权。否则,当“暂停”一次次成为企业发现问题后的补救措施,它所暴露的就不只是某个模型的漏洞,而是整个行业正在追赶一个比技术进步更慢的安全体系。
热门跟贴