近日,国际权威AI网络安全基准测试CyberGym榜单更新,绿盟科技自主研发的NSFOCUS AI漏洞挖掘智能体,以95.02%严格Pass@1漏洞复现成功率拿下CyberGym Level 1全球第一的成绩,在1507项真实开源漏洞任务中成功完成1432项任务,实现国内AI安全智能体在该权威评测上的重大突破。

打开网易新闻 查看精彩图片

什么是CyberGym?硬核的AI安全实战考场

CyberGym 是加州大学伯克利分校推出的AI大模型/智能体网络安全的基准测试集,用来验证AI Agent复现真实软件漏洞、生成PoC漏洞利用代码的能力。

该测试根据PoC构造难度大小,由高到低分为 Level0-Level3四个级别。Level1仅次于Level0,是官方主测试赛道、排行榜默认用的级别:仅给到AI简短漏洞描述与未修复漏洞源码,不能访问修复版本代码;AI需要自主读懂源码、定位漏洞目标函数、构造PoC验证用例,仅可提交一份最终PoC。

本次评测数据集包含ARVO、OSS-Fuzz两大真实漏洞集合,覆盖复杂文件格式、深层调用链、严苛触发条件等各类高难度漏洞场景,高度还原安全研究员真实漏洞复现工作流程。

95.02%!GLM-5.3底座加持,能力再上新台阶

本次NSFOCUS AI基于智谱GLM5.3大模型完成评测,全部1507个任务中成功复现1432个漏洞,整体成功率95.02%。其中:

  • ARVO数据集:1368项任务,成功1298项,成功率94.88%

  • OSS-Fuzz数据集:139任务,成功134项,成功率96.40%

对比上一轮GLM5.2版本93.63%的成绩,整体成功率提升1.39个百分点,多拿下21个高难度漏洞任务。这些新增通关任务大多具备复杂文件格式、深层调用链路、严格字段约束、狭窄触发条件等特点,对模型代码理解、长程推理、动态调试能力提出极高要求。

从执行日志可以看到,GLM-5.3可以更早定位漏洞关键字段,快速响应GDB、Sanitizer调试反馈调整输入结构,面对约束复杂、调用链很深的漏洞,能够更加稳定选择有效的PoC构造策略,减少产生无关崩溃的无效样本,PoC的精准度与可复现能力得到显著提升。

不止依赖大模型:一套工程化的自主漏洞复现工作流

NSFOCUS AI的高分一方面是大模型能力的加持,另外一方面是将绿盟红队多年攻防专家经验沉淀为可计算、可审计、可验证的自动化工作流,把大模型强大的推理能力约束在严谨工程边界之内,实现模型能力与安全领域知识深度融合。

打开网易新闻 查看精彩图片

整套系统分为五大层级:批量任务编排层、单任务求解层、领域知识层、验证工具层、结果提交层。每一个漏洞任务都会分配独立隔离工作空间与容器环境,任务之间内存、上下文完全隔离,保障每一次评测都是干净无干扰的独立运行。

整套自主分析工作流从目标环境确认->静态分析->动态验证->PoC构造与精简->一致性校验->复现与提交完整模拟安全专家的分析思路。

核心技术:五维一致性验证,守住PoC质量关口

五维一致性验证是NSFOCUS AI的关键技术,是PoC提交前的强制闸门,只有全部维度校验匹配,才允许提交结果,从源头规避误报、无关崩溃。

验证内容

需要确认的问题

基本证据

目标文件

崩溃路径是否与题目描述中的文件有关

Sanitizer 堆栈中的目标文件,或能够追溯到该文件的调用关系

崩溃类型

实际错误类型是否与描述一致

检测器报告的错误类别和访问性质

检测器

构建配置和实际检测结果是否一致

镜像内程序的检测器配置及运行报告

漏洞机制

是否执行了描述中的关键分支、操作或条件

GDB 确认的代码位置和运行时数据

输入格式

PoC 是否符合测试程序能够解析的格式

入口代码、关键格式字段和重复运行结果

系统深度融合GDB调试与定向模糊测试:静态分析之后利用 GDB 断点获取内存分配、偏移量、循环边界等真实运行信息;在漏洞机制明确前提下使用模糊测试加速样本搜索;获取样本后交叉核验,不符合漏洞机制的样本不会提交,仅用于迭代分析假设。

同时系统具备完善失败反馈、预算管控、任务恢复机制:单任务最大时限4.5小时,超时将记录审计标记;完整记录工具调用、模型调用、日志时序,方便后续失败案例复盘分类。

AI安全攻防新范式:把专家经验变成可运行系统

当前大模型在网络安全领域落地,最大的难点不在于 “写代码”,而在于如何把安全专家的领域经验、严谨的证据链思维转化为自动化流程,避免大模型天马行空的幻觉输出。

NSFOCUS AI的实践证明:高性能AI安全智能体,不是单纯靠大模型 “单打独斗”,而是领域工作流、调试工具链、多层校验机制与大模型推理能力的深度结合。大模型负责理解代码、提出假设;工程系统负责环境隔离、证据收集、多层校验,二者互相约束,输出可信、可复现的安全结果。

从93.63%到95.02%,数字提升的背后,是AI智能体在真实软件漏洞场景中实战能力的持续进化。未来绿盟科技也将持续深耕AI安全攻防技术,持续探索AI赋能漏洞分析、威胁检测、安全运营的更多落地场景,输出更多实战化安全能力。

合作电话:18610811242

合作微信:aqniu001

联系邮箱:bd@aqniu.com

打开网易新闻 查看精彩图片