英国人工智能安全研究所(UK AISI)与美国人工智能标准与创新中心(CAISI)于近日发布了一项联合评估报告,对月之暗面(Moonshot AI)最新推出的模型 Kimi K3 的网络安全能力进行了深入测评。评估结果显示,尽管 Kimi K3 的网络能力超越了此前公认最强的开源模型 GLM-5.2,但与目前顶级的美国前沿闭源模型相比,仍存在较为明显的差距。
本次测试重点考察了 Kimi K3 在网络漏洞利用开发及模拟网络攻击等领域的实际表现。在卡内基梅隆大学开发的知名网络安全基准 ExploitBench 评测中,Kimi K3 取得了 32% 的成功率,高于 GLM-5.2 的 24%。然而,在代表最高威胁级别的“任意代码执行”(ACE)漏洞利用开发测试中,顶尖闭源模型平均能够完成 20 项任务,而 Kimi K3 的得分则为零,未能成功开发出任何可实现任意代码执行的漏洞利用程序。
在模拟企业网络攻击的“The Last Ones”复杂网络靶场测试中,该任务包含跨越 4 个子网和约 20 台主机的 32 个攻击步骤。测试数据显示,Kimi K3 平均能够推进至第 17 步,优于 GLM-5.2 的平均 11 步,且在 10 次尝试中有 1 次成功通关整套攻击路径。作为对比,目前最顶尖的美国模型在此靶场中平均可推进至 28.5 步,通关率高达 60% 至 70%。这表明 Kimi K3 在获得初始访问权限后,具备自主攻击弱防护小型企业系统的潜能,但其整体稳定性与深度攻击能力距离前沿水平仍有距离。
此外,评估还指出,Kimi K3 现有的安全防护机制未能有效阻断其在智能体(Agentic)模式下尝试网络漏洞利用开发或进攻性网络安全操作。据了解,Kimi K3 于 2026 年 7 月 16 日正式发布,并计划于 7 月 27 日前开源。英美两国 AI 安全机构表示,本次评估仅基于初步测试集,未来还将对前沿 AI 模型的安全边界与能力演进保持持续跟踪。