漏洞管理初创公司Cogent Security扔出一个令人侧目的数字:其刚刚发布的前沿推理模型VR-1,在完全未知的企业环境中,找到攻击路径的能力是其他顶级模型的两倍,而完成这些任务所耗费的成本,只到对手的四分之一。不过,一旦环境信息逐渐开放,这份领先优势便迅速收窄至几个百分点,VR-1本身的成功率也始终未能突破30%。这组看似矛盾的数字,正是Cogent试图向安全行业传递的信号——前沿AI的攻防天平已经倾斜,谁先拿到“专为攻击路径而生的模型”,谁就能在真实的入侵链中赢得时间窗。
VR-1的发布,伴随着一套名为IntrusionBench的自研基准测试。Cogent在其中设置了最极端的“黑箱”配置:给AI代理一个初始立足点和一个最终目标,除此之外,不透露任何关于目标环境的信息。代理需要自行摸清云基础设施的拓扑关系、拆解身份系统的权限链条,还要弄清楚企业实际运行着哪些内部工具。评分只看最终的执行结果——你如果只是声称“理论上能到达目标”,在这场测试里连一分都拿不到。在这种高压设定下,VR-1证明了远多于竞品的攻击链路,并且是以约四分之一的推理算力开销完成的。
对比名单上,站着Kimi K3、Claude Opus 4.8和GLM-5.2这三款公认的前沿模型。Cogent公布的一张图表显示,当这些模型运行在各自默认的运行框架中时,VR-1的攻击路径发现量确实实现了翻倍。不过,当Cogent把三者统一放进自研的AI Harness运行时——这个Harness为模型提供了精准的环境上下文、受限的工具调用以及策略执行检查——所有模型的差距骤然缩小,彼此相差不过几个百分点,而VR-1自身的成功率仍低于30%。随着测试环境中可获取的信息逐步增多,每一个模型的表现都在提升,分数差距更被压得极窄。
这一现象构成了围绕VR-1最有趣的辩论切口。乐观的一方看到的是:在真实入侵场景最模糊的初期,一个专门为串联攻击路径而训练的模型,的确能发现防御者忽视的隐形链路。而谨慎的一方则指出,当“环境透明度”这个变量加入后,前沿模型的通用推理能力很快就追了上来,这说明决定胜负的或许并不是模型本身,而是谁更好地运用了上下文引擎和策略约束。换句话说,VR-1在暗室中的翻倍优势,和Harness内几乎抹平的差距,一起勾勒
热门跟贴