公众号记得加星标⭐️,第一时间看推送不会错过。
在我们大多数人关注高端商业和技术计算的这段时间里,系统的计算部分——过去五十年是CPU,过去十五年是GPU——毫无疑问一直是系统的核心。内存、存储和I/O固然重要,但它们是次要的。
系统和集群的预算重点在于最大化计算能力,其他因素往往被放在次要位置。坦白说,一些组织为了节省内存和 I/O 资源,甚至不惜牺牲 CPU 或 GPU 的利用率。
随着机器学习的出现及其向生成式人工智能和智能体人工智能的演进,内存的重要性日益凸显,并在大多数IT领域取代计算能力,成为控制点。这让我们中的许多人感到有些不知所措,并非因为变革的概念本身,而是因为变革的速度和幅度之大。
以下是 Gartner 最新发布的芯片收入细分数据,其中显示了内存产品与非内存产品的销售额,而就市场研究机构而言,闪存也被视为内存产品:
正如你所见,半导体市场整体呈现出某种摩尔定律式的增长曲线,收入每年翻一番。不妨称之为“摩尔定律”。近乎翻番的增长发生在2025年至2026年间,但正如你所见,预测显示2026年至2027年间的增长速度将放缓——自人工智能时代以来,我们一直认为这是不可避免的。在某个阶段,竞争会加剧;而在另一个阶段,人们将拥有足够的产能来完成他们所需的一切。
我估算了DRAM和NAND闪存的市场份额,您可以根据Gartner在其2026年预测报告中给出的这两类存储器的增长率来计算。我假设其他类型的存储器年产值约为40亿美元,并以全球国内生产总值的两倍增长,这与传统组件和平台的通常增长速度相符。
我还加入了美光最新的HBM内存市场总规模预测,这样我们就可以把其他类型的DRAM——DDR4和DDR5、LPDDR4和LPDDR5等等——排除在外。正如你所看到的,其他DRAM的收入总和将远远超过HBM的销售额,这种情况在可预见的未来可能会持续下去。
商业公司为了提升工作负载的性能,纷纷用DRAM主内存、HBM堆叠式内存和闪存来替代磁盘驱动器,而如今对闪存的需求已远超以往,这不仅仅是因为人工智能(GenAI)对内存和闪存的需求量巨大。我们正处于系统大规模升级的周期中,因为全球服务器集群中那些使用了五六年甚至七年的机器亟需升级。为了节省空间和电力用于人工智能系统,企业正在追求接近最大核心密度,这反过来又推动了对高容量DRAM和闪存的需求。传统的IT行业——包括事务处理、数据仓库、数据分析和网络基础设施——发现自己正与科技巨头及其对闪存和DRAM内存的巨大需求展开竞争。随着内存制造商将DRAM芯片产能转向生产用于人工智能加速器的HBM堆叠式内存以追求更高的收入(但不一定更高的利润),DRAM供应正在趋紧。
这导致DRAM价格飙升。早在2022年11月,OpenAI的ChatGPT开启了GenAI热潮时,服务器用DDR4内存的价格约为每GB 3美元,DDR5内存的价格约为每GB 4美元。(这些价格是中等容量内存的平均值。密度更高的内存每GB的价格要贵得多,而密度更低的内存价格则要便宜得多。)一块30TB的TLC企业级固态硬盘的价格约为每GB 10美分到13美分。四年后,DDR4服务器内存的市场价格上涨了2到3倍,DDR5服务器内存的价格上涨了9到13倍,而那块30TB的TLC固态硬盘的价格也上涨了6到7倍。顺便一提,部分价格上涨是由于2021年末内存和闪存价格暴跌造成的,而这又源于困扰内存和闪存行业数十年的供应过剩问题。
顺便一提,硬盘价格也飞涨。一块30TB的近线硬盘,价格在同一时期内大约翻了2.5倍。如果你以为能买到便宜的硬盘,那就别想了,因为超大规模数据中心和云服务商已经从希捷、西部数据和东芝这三家仅存的硬盘制造商那里采购了绝大部分硬盘。
HBM的情况略有不同。首先,HBM堆叠式DRAM内存的生产商只有三家——三星、SK海力士和美光科技——而且由于市场并非开放,而是专供两家GPU制造商(英伟达和AMD)以及XPU制造商和/或他们的芯片供应商使用,因此没有现货价格。所以,价格信息比较模糊。
2017年HBM2刚推出时,传闻其价格约为每GB 20美元,但两年后价格稳定在每GB 8美元左右。HBM2E提升了带宽,价格约为每GB 10美元;HBM3容量更大,带宽更高,价格也上涨到每GB 12美元左右;而带宽进一步提升的HBM3E价格约为每GB 13.50美元。即将应用于下一代GPU和XPU的HBM4,据传价格约为每GB 16美元——实际上,传闻称英伟达的合同价格为每36GB堆栈560至600美元。不知何故,有些人预期带宽大幅提升的HBM4E的价格将是HBM4的两倍。鉴于上述HBM2到HBM4内存的价格趋势,我对此持怀疑态度。 20 美元/GB 我可以理解,但 36 美元/GB 就难以想象了,即使考虑到好处也是如此。
需要记住的是:自GenAI热潮开始以来,成品HBM芯片的每GB成本仅上涨了1.6倍,而由于生产过程中良率低于100%等正常现象而被丢弃的DRAM芯片数量却随着每一代产品的迭代而增加。目前普遍认为,HBM制造商将在2027年提高HBM4E的价格,以使HBM的盈利能力更接近标准DRAM。
顺便一提,上述HBM成本并非最终用户在其设备上获取HBM内存的实际成本,这与上述DRAM和闪存价格不同。正如我在2024年2月发表的《谁能为HBM内存支付最高价格,谁就掌控AI训练》一文中解释的那样,用户购买GPU和XPU时HBM的成本远高于供应商的采购价格。对于NVIDIA和AMD的GPU用户而言,HBM内存的成本可能占到一半;而对于超大规模数据中心、云服务商或AI模型构建商而言,随着OpenAI携其“Jalapeno”AI加速器加入竞争,HBM内存的成本可能接近其XPU加速器成本的65%。
事情是这样的。我听说了各种传言,说GPU和XPU厂商(以及设计师)都在努力更有效地利用分配给他们的HBM内存。有些厂商选择继续使用更多的HBM3E堆栈,而不是升级到HBM4,这样即使牺牲了一些内存容量,也能保持大部分的内存带宽——这对推理的解码部分至关重要。
据传,英伟达正在放弃其原定于2027年推出的“Rubin Ultra”GPU的计划,该GPU原本计划配备四个基于光栅尺寸限制的GPU芯片,以及高达1TB的HBM4E显存。AMD的“Altair”MI455X GPU加速器则仍将显存容量维持在488GB,而英伟达据称正在考虑在未来的某些Rubin和Rubin Ultra设计中将显存容量降至192GB。
更有可能的情况是,英伟达会将HBM控制器从GPU芯片组移到可定制的基片上,这种设计在HBM4和HBM4E架构中是可行的——英伟达称之为NVHBM,但这并非英伟达独有。其他厂商也会为其HBM堆栈定制基片,而且不少厂商还会像过去十年一直在做的PIM(处理器内存集成)那样,将某些数学函数嵌入其中(尽管PIM技术一直未能获得市场认可),从而使部分运算在内存中完成,而不是通过内存通道传输到GPU或XPU中。
以下是 Nvidia 解释 HBM 堆栈中这些定制基础芯片为何如此重要的原因:“通过将内存控制器集成到 3D HBM 堆栈而不是 XPU 中,NVHBM 可提供高达 30% 的更高内存带宽和 15% 更低的 HBM 功耗,并且与标准 HBM4E 相比,在 XPU 计算芯片上释放高达 25% 的面积。”
如果我是个喜欢打赌的人,我会押注 Rubin Ultra 会利用每个芯片组额外释放的 25% 芯片面积,从而提升两个芯片组的性能,并可能提供 512 GB 的 HBM4E 显存,或者在保持相同带宽的情况下提供 384 GB 的显存。初代 Rubin Ultra 每个 GPU 芯片组有四个堆栈,每个堆栈由 16 个芯片组成,每个芯片 4 GB,从而达到 1024 GB 的容量,并且根据三星堆栈的规格,总显存带宽高达 58 TB/s。通过降低堆栈高度并将芯片组数量减半,可以在保持 28 TB/s 带宽的同时,提供 256 GB(8 个堆栈)、384 GB(12 个堆栈)或 512 GB(16 个堆栈)的容量。
所有 GPU 和 XPU 制造商都在考虑类似的选择,他们真正想要的是在其设备中采用最前沿技术,并以更低的每 GB 价格获得最大的 HBM 容量和带宽。
(来源:编译自nextplatform)
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第4555期内容,欢迎关注。
加星标⭐️第一时间看推送~
求推荐
热门跟贴