1507个漏洞,从ARVO到OSS-Fuzz,涵盖各项高难度挑战——这是一场对AI安全能力的极限测试。近日,在国际AI安全基准测试CyberGym中,深信服旗下的Sangfor AI在固定模型配置下直面全量高难度漏洞任务,最终成功解决1301项,整体成功率达到86.3%,跻身全球前四,位列国内参评团队第一。

这次评测的特别之处在于,Sangfor AI完全依托纯国产基座模型GLM-5.2。相比于依赖海外大模型的选手,这条路径意味着从底层算力到模型推理都扎根于本土技术栈。在安全领域,这种全链条自主性本身就是加分项。

打开网易新闻 查看精彩图片

86.3%的成功率该怎么看?一方面,它能跨过ARVO和OSS-Fuzz两大不同场景的高难度门槛,证明模型已具备面向真实漏洞的泛化能力;另一方面,仍有206项任务未能解决,说明AI安全检测离“全覆盖”还有明显距离。把成功率拆开来看比单纯看排名更有价值。

打开网易新闻 查看精彩图片

CyberGym作为面向AI安全能力的国际基准测试,其任务池不断更新,难度也在持续爬坡。在如此动态的标尺下,固定配置的Sangfor AI能拿下这个成绩,反映的不只是单轮表现,更是一套国产模型+安全能力的体系化验证。国内团队首次站上这个位置,也给了后续参与者一个可参照的坐标。

打开网易新闻 查看精彩图片