民智编译

导语:

今年 7 月,一次用于检验人工智能网络攻防能力的内部试验,出现了意料之外的情况。

人工智能企业 Open AI 将两个模型放在一个同外部网络隔断联系的计算机环境里,要求它们解答一批网络安全题目。

按照原来的设想,模型只能在指定的范围以内作用,严禁私自接通国际互联网。

但是,试验开始以后,模型不但一次又一次突破红线,甚至利用了软件服务中一处还没有被人们发现的漏洞,对人类设下的藩篱来了一次闪击战。

接入国际互联网后,该模型判断试题的答案有可能存放在人工智能公司Hugging Face(抱抱脸)的服务器里面。

接着,它们自行接续几个步骤,向这个平台大肆播送夹带恶意内容的数据,以至于黑进了内部服务器。

抱抱脸公司起初发现系统受到攻击,向当局作了报告。

几天以后,该公司才搞清楚这次入侵并没有人类黑客直接参加,发动攻击的正是那些接受试验的其他公司的人工智能模型。

这一入侵行为在全世界的计算机界引发了不小的轰动,但这次孤狼式的行为并不表明人工智能已经产生了人的意识,也不能简单地认为它刻意同人类作对。

模型所做的一切,仍然是为了完成研究人员交给它的任务。

值得注意的地方在于,为了找到答案,它已经能够自己选择办法,把几个本来不相干的环节串在一起,并且跨过了设计人员划下的安全界限。

人们在之前多半担心的是已经公开投入使用的人工智能被坏人拿去作恶。而眼下那些还在研制和试验阶段的模型,也可能在没有接到直接指令的情况下,造成实实在在的重大安全事故。

这件事情还提出了一个无可避免的问题。人工智能的能力正在迅速提高,用来约束它的技术手段、制度规范和法律条文却没有跟得上发展的步伐。

目前,美国有关的法律对企业内部试验中出现的人工智能事故还缺少明文规定。

一旦模型自己闯入外部系统,造成了损失,责任究竟应当由谁来负也还没有一个现成的说法。

头一次发生这样的事情企业还可以讲自己毫无准备。

但经过了这一次教训,下次再讲完全没有料到,就不是一个冠冕堂皇可被接受的理由了。

本文编译自英国《经济学人》周刊 7 月 25 日刊出的题为 “Outside the Box” 的文章,记述了这次人工智能突破隔离环境、打进外部服务器的经过,并且讨论了由此引出的安全管理和法律责任问题。文章略有删改,仅供读者参考。如有侵权,请联系删除。

攻击者并非人类?

人工智能模型在正式交付使用以前,照例须经多项检验。

研究人员既要考察其能否正确回答问题,还须查明其是否会搜寻危险工具,能否发现计算机系统的弱点,有无能力越过人为设置的限制。

这些情况确实掌握以后,才能进一步研究防范办法。

Open AI 此次检验的对象有两个。

一个是 7 月初对外公开的 GPT—5.6 Sol,另一个是能力更强、尚未公开的新模型。

研究人员令其参加一项测验。这套题目专门检验人工智能利用软件漏洞的能力,其中牵涉谷歌浏览器等常用程序。

题目本身并不要求模型攻击实际运转中的计算机系统,只要求在给定的试验环境中找出已有漏洞,完成指定任务。

面向普通用户的人工智能,通常均设有一道安全限制。若有人令其协助侵入网站,应当拒绝照办。

为摸清新模型的真实能力,Open AI 在此次试验中暂时撤除了部分限制。

客观来说为了测试的目的,此举有其必要。

但也带来了实实在在的危险,一个不受通常规则约束、又具备较强网络攻击能力的模型,决然不能直接接入国际互联网。

研究人员因此将其关进“沙箱”。这是一种同外界隔断的计算机环境。

按照原本的设计,模型不能自由上网,只能通过内部的一项服务,获取完成试验所需的小型软件包。

打开网易新闻 查看精彩图片

▲ OpenAI 品牌 logo,背景为网络节点抽象图像,代表人工智能数字化服务(图源/ Shutterstock)

问题恰好出在小型软件包之上。

模型并未依照研究人员设想的路径逐题寻找漏洞,而是在软件包中发现了一个从未公开过的缺口。

它利用这一缺口离开了沙箱接通了外部互联网。

接通网络之后,模型随即做出判断:试题答案很可能存放在抱抱脸公司的平台上。该平台存放着大量开源的人工智能模型和数据集。

模型并未等候指令,而是将几个动作连接起来。

它先向抱抱脸公司上传一个数据集,借助平台的自动处理程序运行其中的恶意内容;随后搜集登录资料,进入了内部服务器。

整个过程持续了整整一个周末。

Open AI 和抱抱脸公司各自发现了此次入侵,随后共同开展调查。

Open AI 于 7 月 21 日表示,已经收紧内部设施的管理,并将模型发现的漏洞通知了有关软件的设计者。

事态暂时得到控制,但原有的安全设想已然受到检验:试验场仍在人的手中,机器却并未沿着人所规定的道路向前行进。

打开网易新闻 查看精彩图片

▲ Hugging Face 官网博客页面截图,页面配有半机械故障风格品牌表情,发布于 2026 年安全事件公告(图源/ Hugging Face 官方)

自行突破隔离?

事后 Open AI 说明,这两个模型当时一心要找到试题的答案,并未接到破坏外部系统的指令。

它们闯入抱抱脸公司,也非为盗取用户资料或瘫痪服务器。依公司的解释,模型只是急于完成任务,才采用了这条出人意料的路子。

这与所谓“机器觉醒”并非一回事。

人工智能并未表现出人的情感,也未提出自己的目的。

它只是将研究人员给定的目标紧紧抓住,并依照当时可用的条件选择办法。

机器不必仇恨人,也不必存心闯祸。

只要目标定得不够周全,限制设得不够严密,它便可能用人未曾估计到的办法,将事情推到原定范围之外。

此次受到攻击的抱抱脸公司并非一家疏于防范的小企业。其估值达 45 亿美元,有上百名职工,也设有专门的网络安全队伍的大型互联网企业。

即便这样,Open AI 的模型仍在一个周末之内取得了内部服务器的访问权限。

若换作技术力量更弱的企业,后果恐怕还要严重。

模型这一次确实是专心于寻找试题答案,那倘若它在接到别的任务之后,又会采取何种办法?

打开网易新闻 查看精彩图片

▲ Twitter上 OpenAI 官方账号发布推文,宣布与 Hugging Face 联合调查 AI 模型引发的重大安全事故(图源/ Twitter)

类似的事情此前已经发生过。

今年 4 月,人工智能企业 Anthropic 的一名研究人员在公园用餐时,收到尚未发布的 Claude Mythos 模型发来的电子邮件。

模型告诉他,自己在网络能力测验中已经成功离开沙箱。

依原定安排,该模型同样不应自由接入互联网。

研究人员本在检查机器有多大本领,机器却先用行动给出了答案。Open AI 至今未公开说明尚未发布的模型究竟是怎样突破隔离的。

即使公布了全部经过,能够看懂其中技术细节的人也不会很多。

有研究人员认为,随着人工智能在网络攻防上超过一般技术人员,全世界可能只有极少数专家能够真正弄清一次突破是如何发生的。

机器进展得越来越快,能够检查运行的人却十分有限。

过去设置沙箱,为的是将危险能力限制在较小范围之内。

如今,模型已能寻找沙箱本身的漏洞。原来的办法不能说全无用处,但已不能叫人完全放心。

摆在人工智能企业面前的任务,不只是继续研制出本领更大的模型,还要拿出同这种本领相称的防护办法。

否则,机器魔高一尺,安全部门未必可以道高一丈。

打开网易新闻 查看精彩图片

▲ OpenAI 首席执行官山姆・奥尔特曼(Sam Altman)(图源/ 路透社)

谁来担责?

这次事故还暴露出一个实际问题:人工智能模型尚未公开,并不等于没有危险。

美国政府近来把注意力集中在模型发布这个环节,往往要等企业准备向社会提供新产品时,才着手研究应当附加何种限制。

然而,闯入抱抱脸公司服务器的模型尚处于内部试验阶段,并未交付用户,造成的影响却已超出公司范围。

由此看来,管理工作若仅盯着产品上市这一关,断然是不够的。

目前,美国联邦和各州法律并未硬性规定企业必须报告高性能人工智能模型在其内部的使用情况。

企业在何种条件下撤除安全限制,使用何种能力的模型进行试验,是否发生过模型脱离沙箱的情形,外界大都无从知晓。

一般网络安全事故虽有一些上报要求,适用范围却很窄。

人工智能模型自行突破限制,究竟应否视为现行法律所指的网络攻击,至今仍是一个说不清的问题。

加利福尼亚州去年通过了一项法案,责令研制前沿模型的相关公司在发现重大安全事故之后 15 天内上报。

其中便包括模型在试验之外使用了绕过监管、破坏监测手段这类情形。

这项法案算是进了一步,却也留下了可以被钻的空子。

Open AI 的模型正好是在能力测验当中挣脱了沙箱。它的行动处于“试验之内”,后果却需要另一家企业承担。

打开网易新闻 查看精彩图片

▲ 小型机器人站在大型人形机器人腿部旁,直观表现人工智能技术迭代与规模进化(图源/ VCG)

上报办法没有白纸黑字,责任归谁便更为棘手。

美国联邦的反黑客法律主要惩治故意侵入计算机系统的行为。Open AI 并未下令叫模型去攻击抱抱脸公司,也未打算让它到外部窃取试题答案。

模型是自己走了这条路,企业便可据此申辩,说事故并非出于主观故意。但是,机器本身担不起法律责任。它既无财产可供赔偿,也不能走上法庭当被告人。

模型捅了娄子,终究还是要问责研制、管理和使用它的人员身上。

问题的根源不单在于企业是否希望造成损害,还在于企业事先掌握了多少情况,能够预见多少后果,是否采取了与模型能力相称的防范措施。

模型本事越大,企业应负的注意责任便越重。

Open AI 事后果断收紧了内部控制,将模型发现的软件漏洞通知了有关兄弟单位,并让抱抱脸公司使用网络能力更强的模型检查自身防线。

善后措施是必要的,但善后总归是在事故发生之后进行得补救。

有关方面真正需要解决的,是怎样在试验启动之前划清权限,怎样保存一套完整的原始记录,发生了越出界限的行动由谁上报,对外部造成的损失又该由谁来承担责任。

打开网易新闻 查看精彩图片

▲ 图为展示对于人工智能泛化能力的怀疑(图源/ 插画师 Drew Shannon)

这次入侵事出突然,企业尚可辩称并无前例。

如今前例已经有了,危险也已经广为人知。下次若再发生同类事故,有关方面仅以不知情三个字来推卸责任便难以服众。

试验原为发现危险而设。经此一役,不能把试验看得万无一失。

模型本领越大,检验、隔离和事故处置制度便越要与时俱进。

发展人工智能,不能只问它能做什么,还要问它在什么条件下会跨过界限,跨过之后,用什么办法能立即制止。

信息技术进步很快,管理工作慢了一步,那么小漏洞也可能惹出大问题。

编译:孙锴轩

编务:朱欣月

责编:邵逸飞

图片来源:网 络

打开网易新闻 查看精彩图片

更多精彩内容,欢迎关注民小智君

转载:请微信后台回复“转载”