打开网易新闻 查看精彩图片

继7月推出EPYC“Venice”(皓龙9006系列)CPU后,AMD于周五进一步公布了其下一代服务器芯片的详细性能数据。核心论点保持不变:AMD宣称,一款96核高频版本的Venice芯片在SPEC CPU 2026整数速率测试中,性能比英伟达的88核Vera芯片高出约20%。不过,在新发布的白皮书中,该公司对基准测试结果进行了更详尽的拆解。

基准测试细节与争议

AMD的白皮书展示了多种配置差异,但细节透明度有限。特别是在与Vera对比时,AMD混合了来自不同来源的数据,且在部分情况下使用了不同主版本的GNU编译器集合(GCC)。鉴于编译器版本差异会对性能产生显著影响,读者需对此保持审慎态度。

首先来看SPEC CPU 2026的intrate测试结果,该测试主要关注整体吞吐量。这些数据较早,于7月使用GCC 15.2版本收集。intrate测试通常在同一CPU上并行运行多个应用程序副本,标准做法是每个线程运行一个副本。尽管推测AMD采用了此方法,但白皮书并未明确说明。

根据白皮书显示,256核心的旗舰产品9996(此前神秘的9006系列真身)速度是英特尔至强6980P的2.37倍,是Vera的2.24倍。代际对比结果同样令人印象深刻:据称,9996比上一代192核心的EPYC 9965快约78%。

配置差异引发质疑

虽然高层级结果引入了英特尔和AWS的数据,但白皮书重点主要集中在Venice与Vera的直接对比上。从结果看,这对AMD有利,但配置上存在疑点。AMD测试的是降核后的EPYC 9996,将核心数从256个降至96个。

白皮书未提及具体功耗预算,但在AMD最初公布SPEC数据时,96核型号拥有与256核型号相同的600W功耗上限,而AMD 96核高频Venice SKU的TDP为500W。更具争议的是编译器版本:AMD使用GCC 16.1进行测试,并将其结果与英伟达在Vera白皮书中分享的数据(基于GCC 15.2)进行对比。

Phoronix网站曾撰文详解GCC 15与16之间的差异。简而言之,两者存在性能差异,且结果并非总是更好。由于GCC 16提供了更好的优化,编译时间更长,因此在部分编译测试中得分较低,但这能生成更快的二进制文件。具体提升幅度取决于标志位、软件及其他因素。无论如何,使用两个不同编译器版本进行比较并非最佳实践。

内存带宽与工作负载表现

AMD还为Phoronix的初始受控测试提供了一些Vera数据。在衡量内存带宽的行业标准Stream基准测试中,AMD使用的是从256核降至96核的9996,并赋予其600W功耗预算。尽管如此,这一表现依然引人注目:在此对比中,AMD领先约18%,单核性能领先约8%,而在Phoronix最初的Stream测试中,Vera的表现曾极具统治力。

脱离与Vera的对比,AMD还展示了在云工作负载(包括数据库、Java和密码学)中的性能。代际对比再次凸显优势,因为即使在上一代芯片中,AMD在这些工作负载里已处于领先地位。这些测试由AMD自行运行,而非依赖第三方数据,其中Graviton5的结果来自AWS云实例。

类似地,在高性能计算(HPC)工作负载中,AMD进一步拉大了与英特尔旗舰Granite Rapids-AP产品的差距。英特尔下一代数据中心CPU Diamond Rapids预计将于明年发布。

最后是“代理AI工作负载性能”,尽管图表名称可能具有误导性,但AMD实际使用了基准测试进行比较,依次为NGINX、TPCx-AI套件、FAISS、TPC-H和TPC-C,以及多角色代理的重放测试。对于TPC-H和TPC-C,AMD表示其工作负载源自这些基准测试,因此此处结果不可与公开出版的结果直接比较。

虽然基准测试结果引人注目,但在服务器部署的实际语境下,尤其是针对AMD所瞄准的规模而言,其参考价值有限。峰值性能仅是服务器部署的主要考量因素之一,且即使在此指标上,性能也会因运行的软件及其构建方式的不同而出现巨大波动。

总体而言,Venice的表现令人印象深刻,尤其在代际对比中优于任何竞争性对比。希望这预示着AMD未来Zen 6架构在消费级桌面端的顺利推进,但在AMD提供更多详细信息之前,暂不宜对此做出定论。

【星途科讯 图文丨伊贝 首发于ZAKER科技,转载请注明出处】