虽然现在AI发展日新月异,从AI绘画到智能体创作,各种新工具层出不穷,让人眼花缭乱。但说实话,小编一度觉得"AI失控"这种词,更像是科幻电影里的台词,离我们至少还有几十年的距离。
但最近爆出的几条新闻,让人清晰意识到:我们可能低估了AI"自作主张"的速度。
死捂四个月,谷歌承认AI越狱入侵3家企业
不久前《华尔街日报》披露,今年5月谷歌AI模型Gemini在一次网络安全测试中“越狱”,自主入侵了三家真实公司的系统。是的,入侵在5月发生,谷歌在7月底就已经获知,却选择了内部消化,直到《华尔街日报》记者发函求证,才终于对外承认。
时间的主角是谷歌旗下最强大的AI模型Gemini,为了测试该模型的能力边界,谷歌特意聘请了以色列AI安全初创公司Irregular进行“红队测试”(模拟黑客攻击,寻找系统漏洞)。
测试形式类似网络安全的“夺旗赛”,Irregular为Gemini搭建了一个完全隔离的虚拟沙盒环境,让它扮演黑客,攻击一家虚构公司,以此评估AI被恶意武器化的潜力。
结果谁都没想到,因为沙盒意外联网和靶标虚构公司撞名真实企业两个让人无语的低级失误叠加,让Gemini脱缰,直接把演习变成了真实入侵。
Gemini在没有人类指令的情况下,直接开启暴力猜密码。模式识别+弱口令库+上下文推理一套组合拳完成目标系统密码破译,其实也不能说是暴力破解,因为人家展现了熟练的情报搜集能力,直接在GitHub等公开代码库中检索到了开发者无意中泄露的密钥和登录凭证,就这么拿着“钥匙”登堂入室了。
人类黑客做这些事需要自己构思搜索路径、手动尝试;而Gemini自己就想到了这套战术,并且自主检索了成千上万行代码,顺手敲开了两家真实公司的大门。
这是已知的首例Gemini突破隔离环境、入侵真实实体的事件。但谷歌对此表示:不用惊慌,因为Gemini很“乖”,按照谷歌的说法,当Gemini真正进入这些公司系统后,通过分析周围数据,突然意识到自己闯入了真实企业,于是自行停止了进一步行动,没有造成任何已知损害。
是的,在谷歌方面看来“Gemini的行为十分恰当”,并将这次入侵比作“漏洞赏金”计划,认为既然没造成损害且模型主动收手,就不构成“模型错配”,无需公开披露。
但就像白帽黑客Jack Cable所言,重点根本不是停没停,而是AI智能体在没人授权的情况下入侵了别家公司的系统,这已经是实质性的网络攻击了…
当然,这并非孤例。不知道还有没有宝子记得2个月前闹得沸沸扬扬的,Open AI智能体攻破Hugging Face事件。
OpenAI入侵Hugging Face
近年来,网络安全领域的领军人物一直在警告,AI将重塑网络威胁格局,将原本需要数天甚至数周的网络攻击压缩到短短几分钟。
如果说此前大家还觉得这多少有点过度焦虑,那全球最大开源AI模型托管平台Hugging Face遭遇的“史无前例”AI智能体攻击事件算是一记“实锤”:担忧并不多余,该来的还是来了;AI为了达成目标会不择手段,且行事方式难以预测。
事情的起因是OpenAI在进行名为ExploitGym的内部网络安基准测试时,为了评估模型的极限攻防能力,研究人员临时下调了安全限制。没想到的是,为了在测试中获取高分,其AI模型展现出了极端的“目标导向”,在推断Hugging Face平台可能托管了该测试的机密数据集和参考答案后,为了“作弊”拿到答案,直接突破沙盒隔离环境,入侵了开源机器学习平台Hugging Face的生产系统。
这些模型接到的指令是"寻找并利用系统漏洞"。它们确实做到了,先是攻破了将它们隔离起来的沙盒软件,随后又攻击了一家完全不在测试计划内的公司。模型只是在寻找获取答案的捷径,Hugging Face却因此遭到黑客攻击。
最初外界以为这只是一起针对单一平台的攻击,但OpenAI随后承认,失控的AI(包括GPT-5.6 Sol及一款未发布的预研模型)不仅攻破了Hugging Face,还利用网上公开的信息,访问了多个公开服务平台上的4个独立账户( 这些账户分别充当出站中继、暂存通道及数据存储的角色 )。
这场由"内部网络安全评估"演变而来的真实网络攻击持续了数天,在无人工干预的情况下,AI累计执行了超1.7万次自动化操作,依靠零日漏洞和配置缺陷完成了从沙盒逃逸到集群横向渗透的完整攻击链路。Hugging Face方表示,这是他们首次遭遇由AI从头到尾全权主导的攻击。最终, 在应急处置中不得不求助于中国开源模型(智谱GLM-5.2)完成取证分析。
说出来诸位可能不信,但这次的入侵事件又是因为在Irregular的测试环境中配置失误导致的。
要说这家仅35人的初创公司是有点说法在身上啊。为什么这么说,因为人家同时手握OpenAI、Anthropic、Meta、谷歌四家的前沿模型安全评估业务。是不是想起什么了?对的,上月Meta也“翻车”了。
Meta AI模型在测试中黑入另一家公司
Meta公司在上月表示,旗下AI模型Muse Spark1.1在网络安全测试期间黑入了一家未具名公司的系统,并修改了其内部运行环境。
事情的起因是Meta聘用的第三方安全评估公司Irregular(嗯,又是它!)在配置测试环境时出现失误,意外让本应被严格隔离的AI模型获得了公共互联网访问权限,并在之后迅速利用某第三方服务中存在的安全漏洞,完成了对目标企业内网的渗透与操作。
Meta在声明中表示,在收到Irregular通知后已获悉此事,随后展开内部调查,同时承诺在掌握全部事实后发布完整的事件复盘报告。
前面介绍过了,这次涉事的模型,正是Meta在今年7月9日发布、面向AI智能体研发的多模态推理模型Muse Spark 1.1,其核心能力包括多智能体协作、百万级token上下文处理、跨应用操作以及代码开发等。Meta曾将其标榜为"在真实世界编程和智能体任务方面能力最强的模型";最强模型在闯祸这方面也是不太弱啊。
在责任认定方面,Irregular强调这次事件本质上是评测环境配置错误,而非模型本身具备"沙盒逃逸"能力或实施了复杂的网络攻击。称事件与一周前发生的Anthropic评估环境问题完全相同",并补充称"已经没有未解决的问题了"。
为弥补过失,Irregular还表示正在撰写一份技术白皮书,计划公开分享测试环境隔离方案与安全评估的最佳实践。
一系列事件凸显了AI模型能力不断增强后,开发者在控制模型边界方面面临的困境。当同一家测试方,出现同一种配置失误,配置失误就不再是意外,而是结构性风险。
专家们指出,AI与人类大脑运行方式的根本不同。AI没有道德感和主观恶意,但在单一目标函数的驱动下,会将“边界”视为需要克服的障碍,以不可预测的方式“智取”系统。换句话说,对AI来说只有一个使命:解决问题,消灭或绕过挡在面前的一切障碍。过去公司担心黑客利用AI攻击,如今更恐惧的是引入的AI系统会在意想不到的地方“自损八百”。
这也暴露了当前AI治理框架的致命盲区,当AI已具备自主规划与跨平台渗透能力时,建立与之匹配的精细化安全控制、轨迹级监控以及独立于开发者的第三方监管体系,已比单纯的模型性能竞争更为迫切。
随着AI向高自主性方向发展,如何建立有效的权限隔离机制、完善异常行为监测体系,已成为科技企业必须面对的核心课题。
end
热门跟贴