当AI模型能自己找出漏洞、主动发起攻击时,传统的安全防守要怎么跟上一群不知疲倦的机器?这已经不是假设。几天前,OpenAI公开承认,自家的两个模型突破了测试沙箱,成功入侵了AI开发平台Hugging Face。现在,微软端出了一个专门为这种“机器打机器”的新攻防格局搭建的系统——Project Perception,直接把红蓝绿三支AI代理塞进同一条流水线,并且放话:大部分任务,用我们自己的小模型就够了,成本压到大型模型的一半。
这套系统会在8月3日进入公开预览,但现阶段的很多细节已经指向微软在网络安全上的笨办法:不再精挑一个最强模型,而是让多个模型、多个代理分工协作。红队代理负责模拟攻击者的思维,在整个代码库、网络拓扑里寻找可能的攻击路径;蓝队代理接过红队的发现,判断哪些风险确实致命,哪些只是杂音;绿队代理则直接动手修复。不是靠一个AI当万能神,而是把攻防三个环节拆开,让每一拨代理专心做一件事。
支撑这套逻辑的是一个全新的模型MAI-Cyber-1-Flash。微软的说法很直接:这个模型专门为网络安全而生,能干大型模型大部分该干的活,而费用只要后者的一半。它不是为了炫技拼参数规模,而是用高度垂直的训练换来成本优势。只有遇到那10%被微软形容为“异常困难”的任务时,才会帮一把OpenAI的GPT-5.4来兜底。这种混合路线,等于把预算花在刀刃上,平时用小而专的模型撑住,关键时刻再调用重炮。
在衡量AI找漏洞能力的CyberGym基准测试上,这个组合拿下了96%的分数。这整套评测跑的是真实的大型代码库,看AI到底能从里面揪出多少可被利用的弱点。不过,这里有一个让安全圈不太舒服的事实:据《纽约时报》报道,微软在公开发布前,并没有把这个模型交给独立的测试人员。微软自己的说法是,模型接受过第三方独立评估。到底谁是“第三方”,怎么评估的,细节一概不详。在一个把透明度当作安全命门的行业里,这种“信我就行”的态度,用户买不买账还很难说。
而在实际可用性上,Project Perception刚一落地就设了门槛——只对MDASH的客户开放。MDASH本身是微软AI驱动的代码漏洞发现工具。这就意味着,最先享受到这套新能力的,是那些已经在用微软安全工具体系的企业。微软安全业务的负责人Hayete Gallot上周在GeekWire的系列采访里直接说,MDASH就是微软踏进“代理化安全”领域的第一步。她的逻辑很清楚:每天超过100万亿条信号,任何系统都不可能直接去一条条推理。所以微软把这些信号蒸馏成一个图,让AI代理在这个图上去导航,自动把每一条威胁路由到最擅长处理它的那个模型。结果就是,软件可以自行决定隔离某台设备、切断某条访问,不再需要人工层层上报。
用微软CEO纳德拉在X上的总结,这就是“不把安全系统锁在单一模型家族上”的好处。他说,把“挽具”、上下文/信号、行动空间三者和特定模型家族剥离开,反而是取得更好单位成本效果的关键。换句话说,微软不想赌某一家模型的更新节奏,而是搭好一个能随时换芯的底座。这背后的野心,远不只是多卖几个安全许可证。
Gallot在伴随发布的一篇博客文章里,更是直接抛出了“网络新栈”的说法。她认为,整个安全行业的现有架构是为人类攻防选手的速度设计的,根本跟不上AI、智能代理和机器速度下的攻击。现在对手已经不是那个等着被人发现漏洞的黑客了,而是能自动裂变、自动变形的模型。微软这一步,赶的不仅仅是跟谷歌、Anthropic的位次,也是在赶攻击形态本身进化的时钟。
如果只看微软晒出的成绩单,一切似乎都走在正确的路上。但再往行业全局看一眼,就会发现一个巨大的反差:那些同样在AI安全领域下重注的对手,眼下都在更小心地走路。在微软用来基准对比的四套系统中,Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol还被政府掐着脖子,只允许一小撮经过审批的客户接触。一方面是企业自己在大步流星地往前推,一方面是监管在拼命拉缰绳,这种分裂感,比任何一份技术报告都更接近目前AI安全竞赛的真实底色。
一边是OpenAI的模型刚刚从自己家里越狱成功,一边是微软发布会上高调展示96%的防御得分。数字很漂亮,但什么时候开放给更多独立测试者去反复抽打,什么时候这套系统的信任门槛才能真正降到安全从业者愿意接受的那条线,恐怕才是Project Perception接下来要面对的真正问题,而不是另一个更大参数的模型。
热门跟贴