原标题:深信服AI安全智能体登顶CyberGym全球第一
国际权威AI安全评测CyberGym最新榜单显示,深信服AI安全智能体以93.2%的综合成功率强势登顶全球第一,超越OpenAI、Anthropic、Meta等国际AI巨头。该成绩基于纯国产基座模型+固定配置实现,使深信服成为首个在该评测中登顶全球的中国厂商。这标志着中国AI安全能力正式从"跟跑"迈入"领跑"阶段。
一、CyberGym:全球最具含金量的AI安全实战靶场
CyberGym 是由加州大学伯克利分校于2025年6月发布的 AI 智能体网络安全评测基准,被公认为当前全球规模最大、最贴近真实工业防御场景的 AI 安全实战"靶场"之一。与传统的静态理论题评测不同,CyberGym直接聚焦真实世界的复杂安全挑战:测试覆盖大量主流开源软件与高难度历史漏洞集(如ARVO、OSS-Fuzz),不仅要求模型"读懂"代码,更要求其在海量源码、复杂上下文及多阶段对抗环境下完成自主推理、漏洞复现与PoC验证。
换言之,CyberGym榜单衡量的是AI安全智能体"真刀真枪"解决真实漏洞的能力,而非纸面分数。这使榜单第一名的含金量在行业内具有极高的公认度。
二、93.2%登顶全球第一:细分维度数据同样扎实
在此次与OpenAI、Anthropic、Meta等全球头部厂商的同场竞技中,深信服AI安全智能体交出了完整、公开且经得起严苛验证的实战答卷:
• 综合成功率93.2%,位列CyberGym全球第一;
• ARVO来源任务成功率93.13%;
• OSS-Fuzz来源任务成功率93.53%。
在细分维度上,深信服AI安全智能体展现出扎实的稳定性——两项高难度漏洞集任务的成功率均保持在93%以上,说明其能力并非依赖单一场景的偶然发挥,而是具备可复现、可验证的体系化安全推理能力。
三、技术路径:"智能体群体协同作战"如何炼成全球第一
比名次更值得拆解的,是成绩背后的技术路径。深信服没有把赌注押在更强的单点模型上,而是聚焦于一个更核心的问题——如何让大模型的安全推理过程可信、可验证。
大模型做漏洞挖掘的普遍痛点,在于推理难以溯源:多个假设相互干扰、错误路径被反复重试、结论缺乏可验证依据。深信服的应对方案,是构建一套"智能体群体(Agent Swarm)协同作战"架构,核心是以"证据"为线索的推理治理,包含四大机制:
• 有界探索:围绕不同安全假设开启独立、边界清晰的调查分支,避免多个假设互相污染;
• 证据持久化:保留已验证的观察与已证伪的路径,防止同一条错误路线被反复试错;
• 动态假设裁决:持续基于演化中的证据状态收窄搜索空间,提升推理效率;
• 对抗式候选评审:所有候选方案须通过"崩溃是否可复现""崩溃是否真实对应目标漏洞"的双重拷问。
这种"以假设拓展探索、以证据裁定结论"的设计,让系统既能广撒网式地探索多种可能,又能在真正下结论前保持足够的审慎,从根本上解决了大模型安全推理"不可信、不可验证"的行业难题。
四、AI重塑攻防天平:安全能力必须前移至代码开发阶段
当前,AI正在重塑网络安全的攻防天平。在攻击侧,零日漏洞发现已进入工业化阶段——AI能自主挖掘漏洞、组合攻击链并大规模并行执行,大幅压缩从发现到利用的时间窗口。传统"上线后扫描+事中响应"的防御逻辑正在失效,安全能力必须前移至代码开发阶段。
更深层的挑战在于,国产代码安全面临三重壁垒:国产开源模型的安全能力仍有差距,单Agent架构难以应对复杂场景,国外AI安全生态已形成先发优势。能否依托国产模型、以自主智能体架构实现突破,成为掌握代码安全主动权的关键。深信服此次在CyberGym全球登顶的表现,某种程度上验证了这条路径的可行性。
从更深一层看,智能体驱动的安全审计正在改变企业安全与研发的协作关系。传统模式下,安全团队作为"后置关卡"向研发输出阻断性意见,双方常因误报争议和修复排期陷入博弈。而基于证据管治的智能体审计,其结论自带可追溯的验证链条,使安全判断从"权威裁决"变为"证据共识",研发对安全建议的接受成本大幅降低,安全团队也从"流程警察"转向"风险顾问"。
在工程落地层面,据深信服技术团队披露,该智能体已加速沉淀至企业研发全流程,这种将安全能力内生于研发流程的尝试,正在改写企业代码安全的成本结构,帮助企业在更早阶段遏制数据泄露与业务中断风险。
热门跟贴