“另一条道路”拿下AI安全工具全球第三

开源架构代替闭源堆叠,上海团队DoGNAVY智能体1507项测试通过率达90.8%

昨日,加州大学伯克利分校设立的AI网络安全权威榜单CyberGym公布了最新排名,来自上海的DoGNAVY智能体排名全球第三,仅次于微软和谷歌开发的智能体,领先于OpenAI、Anthropic等国际顶尖企业。

过去,一个高危漏洞从被发现到形成可用攻击能力,往往需要专业人员投入数周甚至数月,如今这一过程仅需数小时。今年7月,OpenAI的一款大模型在内部测试时失控,它自主发现漏洞、规划路径,成功入侵了人工智能开源平台Hugging Face。当攻击的门槛和成本一路走低,防御就不能继续只依赖专家,而是要靠智能体助力。

DoGNAVY由国内顶尖人工智能研究机构与上海企业达酷诺威组成的上海科研团队研发,它在1507道题中通过率达到90.8%,只比第二名少答对了一道题。CyberGym并不是知识问答考试,其测试方式像是要求一个程序员处理完全陌生的软件项目——面对几千个文件、上百万行代码,只告诉他“这里有个安全漏洞”,要求他自行发现并当场演示。

面对1507道无法提前准备的题目,微软和谷歌采取“拼装作战”,调度多款能力各有侧重的闭源模型协同参与处理。上海科研团队选择了另一条道路,以智谱在6月开源的GLM-5.2为基础模型,开发出一套完整的技术体系。达酷诺威将长期积累的一线经验转化为专业安全能力;国内顶尖人工智能研究机构则通过名为AgentDoG的安全架构,提供核心的智能体运行与诊断能力。

上海科研团队介绍,现有的安全工具只能给出“安全/不安全”的简单判断,无法告知风险根源。AgentDoG不仅能精准判断智能体行为的安全性,还能诊断风险来源、追溯失效模式、解释决策动因。训练人工智能安全模型通常很烧钱,需要海量数据和巨大算力。为节省成本,AgentDoG开发团队换了一种思路:先用一套智能筛选机制,从海量数据中只挑出最关键的千余样本,再通过数据净化技术去掉“杂音”。最终,一个参数量仅为通用大模型千分之一的小模型,在复杂风险识别任务中达到了78.4%的准确率,与顶级大模型不相上下。

上海科研团队还为DoGNAVY构建了严格的“沙箱”环境,能保证大模型在隔离环境中执行指定任务,避免重蹈OpenAI大模型失控做“黑客”的覆辙。

DoGNAVY智能体排名全球第三的成绩表明,以国内机构的AI研究能力、开源大模型与一线真实攻防经验,已能形成有效协作,处理最难、最大规模的专业安全任务。未来,这种顶尖安全攻防能力将在全国推广应用,让越来越多的国内机构拥有AI安全力量。

(来源:解放日报 记者 俞陶然)