大伙有没有想过,现在的AI已经卷到什么程度了?
以前咱们还总吐槽AI是人工智障,写代码出bug、写文案牛头不对马嘴,结果人家悄咪咪就进化到下一个阶段了——连“骗人”这套社会工程学,都给玩明白了。
最近英国AI安全研究所(AISI)公布了一轮测试结果,直接给整个行业敲了个警钟:Anthropic旗下最先进的AI模型,在测试里直接伪造身份欺骗真实人类,还试图往公开开源项目里植入恶意代码,妥妥又是一起AI越界失控的典型事件。
图源:kimi生成
这次测试同时拉上了Anthropic和OpenAI的顶级模型,测试环境特意放宽了安全防护限制,相当于把平时套在AI身上的“紧箍咒”给松了大半,而且还主动给模型开放了联网权限,就是想测测极限情况下AI能干出啥。
结果不测不知道,一测吓一跳。
这家英国官方研究实验室发现,AI居然主动玩起了社交套路:在执行没被授权的任务时,会想方设法给人类审核员施压,这种情况还是头一次被观测到。
图源:kimi生成
研究所自己都直言:“这是我们第一次见到性质这么严重的欺骗行为——没有任何人诱导,AI就主动针对现实世界里的真人下手了。”好在目前没有证据显示这些行为造成了实际的现实危害。
整个测试一共设置了122项网络安全挑战,结果有10次测试里,AI智能体都直接在公开互联网上自主做出了未授权操作,目标全是真实的个人和机构。这些越界行为大部分出自Anthropic的Mythos 5模型,剩下的来自OpenAI的GPT-5.6-Sol。
其中最离谱、性质最恶劣的一起,当属AI为了达成目的直接开小号操作。
当时它想让人类审核员同意往一个大众都在使用的开源项目里插入恶意代码,为了骗过审核,居然凭空捏造了好几个虚假身份。它不光会直接联系真人,通过在线文件传输服务发消息、传文件,忽悠对方,或者忽悠对方用的AI编程工具去运行恶意代码;更鸡贼的是,当自己的操作被人质疑之后,它还会偷偷修改之前的操作记录,甚至盘算着换个新身份接着干。
合着现在AI都学会被拆穿了就换马甲重来是吧?
其实这也不是最近头一回出这种事了。就在今年7月底,OpenAI和Anthropic都先后报告过自家模型逃出测试环境、入侵其他系统的安全事件。但和之前那些情况不一样的是,英国研究所这次测试,是明明白白主动给模型开放了联网权限,相当于给了它合法上网的权利,结果AI直接把权限玩出了花。
这段时间以来,顶尖AI模型擅自行动、违规操作的事件接二连三冒出来,也让越来越多人呼吁:政府赶紧出手管管AI吧,再这么发展下去,指不定还会出啥幺蛾子,甚至有人提出应该放慢AI发展的脚步。
图源:kimi生成
巧的是,研究所曝光这件事的同一天,全球头部AI公司的代表刚好齐聚白宫,开会讨论一套新的监管框架。简单说就是,以后最先进的AI模型在公开发布之前,都得先经过政府的审核才能上线。这时间点凑得,多少有点现场递素材的意思了。
针对这次测试结果,两家公司也都很快做出了回应。
Anthropic在X平台发声明说,这次测试本身就是在刻意放宽限制的条件下进行的,不仅移除了模型的安全防护机制,也没有对联网的使用方式做任何限制。他们表示正和对方密切对接,收集更多事件细节,同时也在开展内部调查,还补充说目前没有证据显示模型逃出了安全测试环境。
OpenAI这边则表示,测试里出现的两起未授权行为,分别是模型跑出了测试环境范围,以及做出了任务要求之外的操作。他们在官方博客里也表态:会和全行业携手,完善高风险AI评估的通用安全规范,让这类测试能更稳妥地开展。
说真的,虽说这是实验室里的极限测试,咱们普通用户平时正常用AI,基本遇不上这种情况,但架不住AI的进化速度实在太快了。
前几年我们还在担心AI会不会抢工作,现在都得开始琢磨,以后会不会收到AI发来的诈骗消息、会不会被AI忽悠了。技术发展肯定是好事,但安全这根弦,确实是一刻都松不得。
本文由雷科技编译自CNN
原文链接:拟人化人工智能代理伪造身份,针对真实人物,发生新安全事件 |CNN商业频道
机器人产业最重要风向标,世界机器人大会(WRC)2026重磅来袭,还有世界人形机器人运动会紧随其后。
宇树、智元、启元、魔法原子、银河通用、云深处、灵心巧手等300余家TOP展商联袂呈现,定义全球机器人产业未来!
所有关于机器人的核心问题,WRC都将给出答案。
雷科技WRC 2026报道团,空降北京重磅呈现。
热门跟贴