打开网易新闻 查看精彩图片

国际主流AI安全基准CyberGym最新发榜,复旦大学杨珉教授团队研制的白泽智能体Whitzard以91.2%的成功率位列全球第二、高校第一。这标志着我国高校自主研发的智能攻防技术已经进入全球第一阵营。

最新榜单中,中国团队占据全球前两名。深信服Sangfor AI以93.1%位列第一,复旦白泽紧随其后,第三、四名分别为美国微软MDASH和美国Wiz公司(Google 320 亿美元收购的网安巨头)。

这是中美网安力量在AI攻防领域的两种范式碰撞:美国团队靠闭源模型矩阵与规模算力展现“算力美学”;复旦白泽则深耕“AI for Security”,通过基于程序运行时约束的推理空间收敛机制破解长链推理膨胀,展现以学术创新释放模型潜能的“效能美学”。

作为国内唯一实现网络安全四大顶会杰出论文奖“大满贯”的团队,复旦白泽正将长期积累的理论创新转化为智能安全领域的新质生产力。

CyberGym由加州大学伯克利分校发起,收录了188个大型开源项目的1507个真实漏洞的基准测试,要求智能体在数百万行代码的完整仓库中,自主完成漏洞定位、路径分析、攻击构造与沙箱验证,是衡量AI实战攻防能力的国际竞技场。

此前,白泽智能体曾取得68.9%的阶段性成绩。经过对长程推理与动态验证机制的持续迭代,结合DeepSeek-v4-Flash,最新版本成功攻克1374个真实漏洞,成功率提升至 91.2%,相比 DeepSeek 官方成绩提升14.5%。这也进一步表明:真正面向复杂真实任务时,模型本身与智能体机制如何协同设计,正成为新的技术突破口。

美国产业的“算力美学”:微软 MDASH 与 Wiz Atlas 均采用多模型、多智能体集群架构,调度超100个专业Agent并行探索与协同,以高密度的计算投入扩充搜索边界。中国团队的“效能美学”:复旦白泽采用自主研发的WhitzardOS模块化框架,专注于提升单次调用的有效推理密度。将程序运行产生的路径可达性与动态状态转化为推理约束,驱动智能体剔除假说、收缩路径,实现推理空间的精准收敛。

特别是,白泽智能体全程仅调用 DeepSeek-v4-Flash 单个基础模型,1507 全量漏洞测试的模型调用总成本不足5000元人民币,远低于美国方案的成本,极致的性价比打破了“AI安全必须依赖高额算力”的常态,展现出国产技术路线的硬核优势。

上述成绩表明,基础模型决定能力起点,而领域知识、算法机制与系统架构的创新,能够持续拓宽攻防智能体的能力上限。白泽智能体的核心目的是以攻促防,打造智能时代的安全守门人。

团队青年教师戴嘉润和潘旭东表示,91.2% 只是新的起点。未来,团队将继续深化理论突破,以具备安全边界的硬核科技,护航国家数字经济社会安全。

原标题:《AI攻防全球第二、高校第一,复旦白泽以“效能美学”跻身世界第一梯队》