生成式人工智能浪潮之下,超大规模算力集群对内存的数据吞吐能力提出了前所未有的严苛要求。作为当前AI加速器最核心的配套存储方案,高带宽内存(HBM)正从单纯的存储器件,转变为决定整套 AI 计算系统上限的关键一环。在今年的Hot Chips大会上,SK海力士发布的一份技术报告传递出了一个核心观点:HBM后续的技术进步,不仅有赖于DRAM电路性能的优化,还离不开先进封装技术、更高密度的垂直集成、热管理能力的提升,以及内存与处理器设计之间更紧密的协同配合。

从底层架构来看,HBM依靠垂直堆叠的独特设计打破了传统内存的带宽桎梏。HBM技术方案将多颗DRAM裸片层层堆叠放置于基础裸片之上,通过贯穿硅片的硅通孔TSV实现堆叠层之间高速信号互通。完成堆叠后的完整内存封装,与GPU、AI加速器共同排布在同一块硅中介层,依托成千上万条并行互连通道完成处理器与内存之间海量数据的实时交互。

对比传统外置内存架构,这种近距离宽带宽互连模式,在大幅缩减信号传输路径的同时,极大释放了内存带宽潜力,还能够有效节约主板上宝贵的布线空间。报告通过HBM3E与GDDR6的对照测试直观展现出架构层面的优势,四组HBM3E封装即可实现144GB存储容量以及约4TB/s的带宽输出,而达成同等能力需要部署十二颗GDDR6器件,前者所占用的电路板面积仅为后者方案的一半。除此之外,在高速数据传输场景当中,HBM3E在每比特传输能耗指标上同样表现出明显优势,为高负载数据中心降低长期运营功耗打下硬件基础。

大模型训练与推理业务的持续扩张,让AI系统对存储提出三重并行诉求:面向并行计算的更高带宽、适配千亿级大模型的更大容量,以及为控制数据中心散热与运营成本所需的更优能效。每一代HBM产品的研发目标,都向着带宽、容量、能效三大方向同步推进。随着技术代际不断更迭,HBM的峰值带宽实现了跨越式增长,从HBM2E约460GB/s,升级至HBM3的717GB/s,HBM3E进一步达到1024GB/s,而全新一代HBM4更是将峰值带宽拉升至2048GB/s。带宽翻倍背后的核心改动,来自接口总位宽的扩容,HBM4把数据通路数量由1024条提升至2048条,从硬件物理层面拓宽了数据传输的通道。

性能指标跨越式提升的另一面,是制造端难度的急剧攀升。HBM4一颗封装内部硅通孔数量已经超过两万颗,微凸点的数量也达到一万六千余个。堆叠层数增加、封装尺寸放大,给整个生产链路带来一连串复杂的工程难题。

晶圆减薄之后裸片更容易发生翘曲变形,堆叠层之间凸点高度的一致性管控、狭小缝隙内部填充材料的工艺把控、多层互连焊点长期运行的可靠性保障,以及高密度堆叠结构下的热量导出,都成为摆在产业链面前亟待攻克的关卡。HBM属于多层一体化堆叠器件,堆叠体系当中任意一层裸片出现微小缺陷,都有可能造成整套成品失去使用价值。正因如此,高精度的缺陷检测流程,以及已知良好堆叠裸片的可靠性测试,已经成为HBM量产制造当中不可缺少的质控环节。

为平衡堆叠层数、生产良率与热阻指标,SK海力士将模塑底填批量回流工艺MR‑MUF视作现阶段主力量产技术路线。不同于热压键合工艺需要逐一对每一颗裸片施加压力与高温完成贴合,批量回流技术能够一次性完成堆叠内部大量互连点位的焊接,之后再注入保护填充材料完成整体封装。这条工艺路线可以有效提升大规模生产的效率,同时降低堆叠结构的整体热阻。

但随着堆叠层数不断加高,该工艺对于裸片翘曲以及层间窄间隙的容错空间也在持续收窄,对前期晶圆加工精度提出更高要求。依托迭代优化后的MR‑MUF工艺,SK海力士已经成功开发出16层堆叠规格的HBM3E产品,实现48GB存储容量,并且将整体封装高度控制在775微米以内,在有限垂直空间内完成了存储密度的提升。

放眼更远的技术路线,当HBM堆叠层数迈向20层甚至更高时,混合键合技术将逐步接过接力棒,成为下一代高密度堆叠的核心解决方案。混合键合摒弃传统焊料微凸点结构,让介质层表面与铜互连触点实现直接接合。取消凸点之后互连间距能够进一步缩小,在同样的封装面积内可以布设更多硅通孔,以此支撑更高的带宽目标。

与此同时,节省下来的垂直空间,可以用来选用机械厚度更大、结构稳定性更强的DRAM裸片,在堆叠层数提升的前提下改善器件本身的机械耐久度。铜‑铜直接互连还拥有更优异的导热性能,随着堆叠当中处于工作状态的DRAM层数越来越多,散热带来的压力持续上涨,这项热传导上的优势价值将会进一步凸显。

热管理已经不再是后期优化项,而是HBM架构设计之初就必须统筹规划的核心课题。带宽提升必然带来内存功耗上涨,而垂直堆叠本身天然形成热量向上传导受阻的物理困境,越靠内层的裸片散热路径越长,越容易出现局部热点。

针对这一痛点,SK海力士提出i‑HBM创新架构,在发热量最高的层与层之间的界面区域,嵌入电绝缘同时具备高导热属性的专用构件,以此搭建一条独立高效的散热通道。根据报告当中的仿真测算结果,该架构最高有望实现30%以上的热阻降幅。除增设专用散热通路之外,基础裸片采用先进逻辑制程可以从源头降低基底电路运行功耗,而将供电硅通孔均匀分布在整个堆叠封装内部,则能够优化整体供电网络,减少供电链路损耗带来的额外发热。

一系列封装与热管理层面的技术攻坚,最终指向AI算力产业当下最为突出的内存瓶颈。现如今AI算力芯片的硬件性能越来越难以完全释放,系统整体性能上限,往往受制于内存向高速处理器输送数据的速度与效率。即便加速器本身拥有极强的运算能力,一旦出现算力单元等待内存数据加载的情况,就会造成计算芯片空置,电力、散热等配套资源被无端消耗。HBM的出现有效缓解了内存墙带来的制约,而行业也逐渐意识到,决定HBM能否充分释放带宽潜力的关键,早已落到了过去被视作次要制造环节的封装工艺之上。

这份报告也映射出整个存储与算力产业正在发生的结构性转型。在过去传统的服务器硬件生产流程当中,内存属于系统组装后期才进行装配的零部件,存储与处理器之间相对独立。而面向AI的先进异构集成封装方案里,HBM必须在项目开发早期,就与高成本算力芯片、硅中介层完成一体化协同设计。HBM器件还要能够承受台积电CoWoS封装、重布线层中介层、嵌入式桥接等异构集成技术在生产和长期运行过程当中产生的各类机械应力。产业边界随之被打破,内存供应商、晶圆代工厂、处理器研发企业以及封装测试厂商之间,已经不能再按照过去分段开发的模式推进项目,多方协同必须前置到产品定义阶段。先进封装早已超越单纯的器件组装手段,成为未来AI系统能否达成预期带宽、存储容量、长期运行可靠性以及高能效目标的决定性力量。