再过几天,AMD就要在“Advancing AI”活动上亮出全新的MI400系列数据中心加速器。但在官方正式登场之前,我们决定先做一些“茶叶占卜”——从LLVM的代码提交里,提前推断这颗下一代加速器到底藏着哪些改变。

目前LLVM已经初步支持了两款新加速器,代号分别是GFX1250和GFX1251。GFX1250是一颗面向机器学习市场的芯片,对应产品叫作MI455X,将用于Helios机架。而GFX1251则瞄准HPC领域,命名为MI430X,AMD预计它能提供超过200 TFLOPs的原生双精度浮点算力。

打开网易新闻 查看精彩图片

这一次我们先聚焦GFX1250,GFX1251留到下次再说。对比的对象包括消费级的RDNA架构、前代CDNA加速器,也会稍微拉上NVIDIA的Blackwell做个参照。有一点值得玩味:虽然大家都知道这些加速器不是APU,但LLVM里它们却被标记成APU身份,这种“错位”本身就像一条暗线,暗示着软件层面的某种统一策略。

GFX1250跟RDNA4最明显的相似之处,在于Workgroup Processor(WGP)的组织方式。每个WGP由两对SIMD32阵列构成,但同时又像GCN和CDNA那样,每个Compute Unit(CU)包含四个SIMD。表面上看这像是概念打架,其实是因为软件已经完全不需要再区分WGP里面的两个CU,AMD也开始把这两个术语混着用。这种“变化”在硬件层面可能压根儿不存在,核心原因在于缓存层级有了调整——整个WGP共享一个矢量L0缓存,对于编译器来说,坚持区分CU已经失去意义。

更有趣的差别在波形模式上。GFX1250只支持Wave32模式,不像RDNA还可以同时跑Wave64。前代CDNA GPU则只能跑Wave64。从性能工程的角度看,把老内核往新加速器上迁移肯定会遇到一些奇奇怪怪的问题,大量内核都需要针对新架构重新评估。仅这一条,就足够让底层优化团队折腾一阵子了。

还有一项硬指标把GFX1250的硬件潜力直接拉高了一档:每个SIMD可以同时运行20个Wave,而RDNA4只能跑16个。多出来的这4个Wave,意味着在面对高延迟隐藏需求时,这张卡拥有更大的“线程池”来保持流水线吃饱。四波之差听起来不大,但在大规模并行任务里往往是吞吐量的分水岭。

没人能断定这些特性是否预示着AMD整个GPU产品线的未来走向,但我个人猜测,这是一个清晰的前奏:未来某一代AMD GPU会彻底锁定在Wave32模式,而目前这种“WGP”形态最终也会像渡渡鸟一样消失。不过,这件事显然不会在短时间内发生。

机器学习能力的核心变化来自矩阵运算。GFX1250像RDNA4一样获得了WMMA(Wave Matrix Multiply-Accumulate)支持,取代了CDNA上老旧的MFMA。这颗芯片绝大多数的AI加速本领,几乎都寄托在WMMA上面,后续我们再详细拆解。让人意外的是,RDNA4上大力宣传的动态VGPR分配功能,在GFX1250里却不见踪影。这实在有点不合常理——机器学习负载下的寄存器压力通常更大,按说更该用上这种动态分配逻辑才对。AMD在这个节骨眼上跳过这一功能,背后的考量恐怕不单纯是技术原因。

对比前代CDNA,GFX1250的生态显然在朝着更接近消费级RDNA的统一框架靠拢。共享的L0缓存、WMMA的引入、仅Wave32这一设定,都像是在试探一条收敛路线:把AI加速器和游戏显卡的软件栈捏合得更紧。与此同时,保留SIMD数量上的灵活调整,又给了数据中心产品足够的差异化空间。

站在NVIDIA Blackwell面前,这种设计取向显得有点另类。Blackwell把张量核和CUDA核的分工推到了更极端的地步,而AMD似乎在用更单一的运算资源去应对多种场景。单从每SIMD的Wave数量来看,GFX1250的并行窗口确实更宽,这或许能给某些不规则负载带来意外优势,但缺少动态VGPR又可能在不经意间拖后腿。

说到底,这一轮LLVM提交泄露的只是硬件能力的冰山一角,实际能效、带宽配置、集群互联这些关键拼图要等正式发布才会水落石出。但至少现在可以确认一点:AMD在AI加速器的架构选择上,走的已经不是简单复刻CDNA的老路,而是在消费级RDNA的骨架上重新嫁接数据中心基因。这种“混血”到底能跑出多大的实际性能,不久后就会见分晓。