随手先关注,不错过每日AI热讯速递

马斯克北京时间 10 月 5 日凌晨发帖,宣布Grok 4.7登顶 Artificial Analysis 网络安全指数——但官网给出的第一名,其实有两个[1][2]。

官网排行榜页面写得分明:Grok 4.7(xhigh)56 分、小米 MiMo-V2.6-Pro 56 分并列最高,GPT-6 Luna(Max)53 分列第三[1]。

①

先看这份榜单的分量。Cyber Index(Artificial Analysis 推出的网络安全能力复合指数,测的是模型在网络防御任务上的真实攻防水平)测的不是聊天,而是发现漏洞、复现验证并完成修复补丁的完整链条[1]。

它由三项子评估合成:CWE-Bench-AADeepsecBench-AA分别基于 Collinear AI 与 Vercel 的基准[1]。

第三项CyberGym-E2E-AA则基于伯克利 RDI 的 CyberGym-E2E;三场测试全部由 Artificial Analysis 独立执行[1]。

这份指数还有一个产业背景:Artificial Analysis 与Cyber Index Alliance联盟共建[1]。

这家联盟(由 IBM、NVIDIA、Collinear AI、Vercel 等厂商参与,意在为 AI 模型的企业网络防御表现设立新标准)的另一层含义是:企业采购时的「安全能力」,正在变成可量化的指标[1]。

打开网易新闻 查看精彩图片

图:榜单卡直接标出「#1Grok 4.7」与小米 MiMo 并列的 56 分(来源:[1])

②

马斯克的宣传比官网口径更省略。他的原话是——

「Grok 4.7 is #1 on the AA Cyber Index」

——马斯克称,Grok 4.7 是 AA 网络安全指数的第一名[2]。

官网的完整表述则是并列最高:56 分的MiMo-V2.6-Pro与 Grok 4.7 同分,而前者是小米的开源模型——一个走低成本、开放权重路线的国产选手[1]。

③

两个细节值得放大。

其一,成本。官网同页的「指数得分 vs 单任务成本」散点图里,Grok 4.7 位居高成本一端,MiMo-V2.6-Pro 则落在「最具吸引力象限」——同等分数、成本量级不同,这正是企业采购最敏感的权衡[1]。

其二,口径。宣传说「第一」,数据说「并列」——差的不只是一个名次,而是美国旗舰闭源模型与中国开源模型在同一份安全榜单上打平这个事实[1][2]。

同时,Cyber Index 只覆盖网络防御三类场景,不代表综合能力排序;榜单本身上线时间不长,结论还有待后续持续检验[1]。

但对政企买家而言,这份由 IBM、NVIDIA 等参与的联盟榜单正在变成采购参考的一部分——安全能力的可验证名次,分量在变重[1]。

安全榜单上中美模型同分,你觉得企业会为省成本选开源,还是为省心选闭源?评论区聊聊。

参考来源:

[1] Artificial Analysis Cyber Indexhttps://artificialanalysis.ai/evaluations/artificial-analysis-cyber-index

[2] Grok 4.7 is #1 on the AA Cyber Indexhttps://x.com/elonmusk/status/2106787000682426513

欢迎点赞、分享、推荐

一起拥抱AI