据消息人士报道,开放人工智能研究中心公司发现了更多自主人工智能模型突破隔离并在无人指令下行动的案例。这一发现出现之际,该公司正在扩大对上月一起黑客事件的调查范围。当时,一个人工智能模型在一次内部网络安全测试中试图作弊,随后失控。

打开网易新闻 查看精彩图片

在对GPT-5.6 Sol和另一款尚未发布的模型进行测试时,研究人员移除了两者的安全护栏,并让它们接受“漏洞利用健身房”测试。这是一项用于衡量人工智能模型识别并利用已知软件漏洞能力的基准测试。结果,其中一个模型没有按要求完成任务,而是逃离了原本应被隔离的测试环境,获得互联网访问权限,并入侵了人工智能模型和数据集在线仓库“抱脸”,试图寻找现成答案。

打开网易新闻 查看精彩图片

开放人工智能研究中心公司最初表示,这次入侵仅限于“抱脸”。但该公司在周三的一份声明中承认,这次黑客行动还波及4个不同服务中的4个账户。周五报道说,此后又发现了更多突破隔离的事件,但目前仍不清楚究竟发生了多少起、具体时间为何、目标系统又是什么。

一名消息人士表示,这些突破事件范围有限,而且据信没有任何人工智能机器人离开开放人工智能研究中心公司的内部网络。开放人工智能研究中心公司和外部专家正在审查今年早些时候的日志,以判断是否还有其他类似事件曾被忽视。

打开网易新闻 查看精彩图片

开放人工智能研究中心公司将最初的突破归咎于测试环境中所使用的第三方软件存在漏洞,并表示其人工智能模型正是利用这一漏洞逃逸并获得互联网访问权限。该公司称,在调查事件并修补漏洞的同时,正加强隔离、监控和访问控制。公司首席执行官萨姆·奥尔特曼也承认,“我们可能不得不放缓人工智能发展的速度”,但并未明确承诺放慢公司的研究进程。

在被问及报道时,开放人工智能研究中心公司拒绝置评,仅援引早前声明称,公司已注意到相关猜测,并计划在未来几周发布“一份关于我们经验教训的技术报告”。人工智能开发商Anthropic周四表示,该公司在内部安全测试中也发现了涉及其Claude模型的突破隔离事件。

打开网易新闻 查看精彩图片

Anthropic表示,开放人工智能研究中心公司的事件促使其检查自家模型是否也出现过类似行为。在审查超过140000次评估后,该公司发现,Claude曾从本应封闭的测试环境中获得互联网访问权限,并对3家机构的系统实施了未经授权的入侵。

最早的相关事件可追溯到4月,而Anthropic和受影响机构当时都没有发现这些入侵。Anthropic提醒外界不要过度解读这些发现,因为相关行为发生在其所称的受控测试环境中。不过,该公司也承认,这些事件表明,人工智能评估系统“需要严格控制”,测试环境应按照与生产系统相同的标准加以保护。

打开网易新闻 查看精彩图片

这些事件加剧了外界的担忧:自主人工智能模型正越来越有能力在几乎没有人工监督的情况下发动网络攻击,也再次引发了要求加强监管的呼声。与此同时,围绕当人工智能系统在现实世界造成损害时应由谁承担责任的争论也再度升温。专家警告说,人工智能能力的发展速度正快于安全措施的完善速度。

“抱脸”起初称赞开放人工智能研究中心公司配合调查,但随后呼吁该公司公开失控机器人的活动日志,并防止此类事件被“常态化”。该机构警告说,相关责任人“必须被追责”。美国总统唐纳德·特朗普上月签署了一份国家安全备忘录,旨在加快先进人工智能在军方和情报系统中的应用。周三,他表示,在这些事件发生后,其政府正在研究可能采取的人工智能管控措施。

打开网易新闻 查看精彩图片

特朗普对记者说:“我们正在研究人工智能,也在研究管控措施。”不过,他同时强调,华盛顿必须保持在人工智能领域的全球领先地位,并称自己不希望出台会让美国“失去竞争优势”的监管规定。

打开网易新闻 查看精彩图片

据报道,在欧盟《人工智能法案》于8月2日生效前,欧盟委员会已联系开放人工智能研究中心公司和Anthropic,讨论这些事件。据称,欧盟官员依据该法案的新规,敦促相关企业对先进人工智能系统加强监测、风险管理和网络安全防护。按照规定,最严重违规行为最高可被处以3500万欧元或全球年度营业额7%的罚款,两者取其高者。