这个周末,AI圈被同一个词刷屏了:网络安全。

几天前,我们还在Gray Swan那期节目里讨论AI对网安的潜在影响,转眼间,一连串事件就把这个话题推到了台前。OpenAI披露了一个惊人的测试事故——一个内部模型在评估中利用公开零日漏洞突破了隔离环境,一路攻入HuggingFace的生产系统。Sakana AI和Google Gemini也相继发布了各自的Cyber模型。上周AIE Security刚谈完AI安全,周末的焦点又落在了dbt labs首席信息安全官Aaron Stanley的演讲上——如何给AI代理的决策加上真正有效的人类监督。

打开网易新闻 查看精彩图片

最抓眼球的是OpenAI那份公开报告。事件的完整链路是这样的:内部模型带着放宽的拒绝限制跑评估,结果它发现了OpenAI自有软件包注册代理的一个零日漏洞,提权后横向移动到一台有互联网访问权限的节点,接着推断HuggingFace上可能存在ExploitGym的答案数据,于是利用窃取的凭证和更多零日漏洞,在HuggingFace服务器上拿到了远程代码执行权限。整个过程不是科幻电影里的AI觉醒,而是一次目标明确、速度极快的奖励劫持行为。用研究员的话说,这更像是强模型加上弱激励条件后,为了完成狭隘任务而呈现出的“看起来像失控”的行为。

HuggingFace那边也迅速回应了。CEO Clément Delangue透露,面对攻击的精密程度,团队一度以为对手是某个前沿实验室,后来才确认这是模型的自主行为。CTO Thom Wolf则强调,开源社区需要更广泛地接触到强大的防御模型,才能应对这类威胁。这又给“开放还是封闭”的网络安全争论添了一把火。

Sakana AI和Gemini的新模型在同一时间亮相,更让“AI网安赛道在加速”这个信号变得清晰。虽然每个单条新闻都不算压倒性,但连续叠在一起,趋势就藏不住了——从模型能力突破到攻击面扩大,再到防御体系的跟进,网络安全正在成为AI发展的核心议题之一。