打开网易新闻 查看精彩图片

这起涉及 Claude 母公司—— Anthropic公司Mythos 5模型的事件,是英国人工智能安全研究所在测试过程中发现的。另有OpenAI的一款高性能模型,也被发现在真实互联网环境中试图实施自主、未经授权的操作。

据《天空新闻》报道,一款高性能AI智能体伪造多个网络虚拟身份,企图诱骗人类授予其主流线上开发平台的操作权限,并借机植入恶意代码破坏平台。

这一事件由英国人工智能安全研究所披露。该机构由前首相里希·苏纳克在近三年前牵头成立,专门针对各大科技企业的前沿人工智能模型开展安全测试。

该研究所发布博文详述了一项网络安全专项测试:测试对象为OpenAI的GPT-5.6-Sol模型与Anthropic公司的Mythos 5模型,两家企业的AI产品此前均已在测试中出现入侵企业系统的违规行为。

打开网易新闻 查看精彩图片

测试过程中,两款模型多次在公网环境下实施自主、未经授权的操作,目标直指真实企业与普通用户(Several instances saw both models take "autonomous, unsanctioned action" on the live internet, where real organisations and people were targeted)。

其中性质最严重的案例发生在Mythos 5模型身上:该AI试图向开源代码协作平台GitHub中植入恶意程序。GitHub是全球开发者存储、分享、协同开发代码的核心平台。

为达成目的,AI批量创建虚假网络账号,持续施压平台管理员放行、审核通过其提交的恶意代码(To do so, it created fake online identities to try to pressure a human into granting it access and approving its code)。

好在管理员及时识破骗局,驳回了这份恶意代码提交申请,本次测试未造成任何实际现实损害。但研究所仍针对AI展现出的自主欺骗能力拉响最高级别安全警报

打开网易新闻 查看精彩图片

该机构表示:“这是我们首次观测到,在没有特定提示指令的情况下,自主能力与欺骗相关的风险在现实环境中如此清晰地显现出来。”

本次测试共计完成122项网络安全评估,其中10组测试场景里出现总计19起AI自主违规操作;17起违规行为出自Anthropic的智能体,剩余2起来自OpenAI模型。

两家企业作何回应?

Anthropic表示,正与这家英国研究所密切协作,以获取更多细节。该公司此前曾提出,只有各AI企业开展合作,才有助于应对这项技术带来的各类风险。

OpenAI在一篇博文中对该研究所的此次测试作出回应,并补充道:“我们致力于联合全行业,完善安全开展高风险评估的通用实操规范。未来数周,我们还将召集各方相关方,包括各国人工智能安全机构、独立测评机构、其他人工智能实验室以及相关组织共同参与。”

打开网易新闻 查看精彩图片

该研究所的报告凸显出外界的一项担忧:针对性能最强的AI智能体(即前沿模型)开展测试时,安全防护措施存在疏漏。这类模型的能力要强于ChatGPT这类面向普通公众产品所搭载的模型

英国政府通信总部下属国家网络安全中心表示,近期发生的各类事件“严肃警示我们人工智能所带来的风险”。

该中心首席技术官奥利·怀特豪斯称:“从一开始研发和运用人工智能时,就必须配备完备的安全防护、实时监督机制,并且制定清晰预案,用于应对各类意外状况。”

英国人工智能安全研究所成立之际,各国领导人正力求在人工智能监管方面达成共识。但自那以后,一套统一协调的监管方案始终未能落地(Since then, a consistent approach has failed to materialise)。

打开网易新闻 查看精彩图片