公众号记得加星标⭐️,第一时间看推送不会错过。

据The Information周四报道,英伟达计划投资人工智能服务器芯片开发商d-Matrix,该报道援引了三位知情人士的消息。

据The Information报道,D-Matrix公司开发的AI服务器芯片与英伟达的产品展开竞争。这项投资计划是英伟达为使其技术与竞争对手的芯片设计商兼容并将其整合到自身硬件生态系统中而采取的举措之一。

该项投资的财务条款尚不明确。

曾经的英伟达竞争对手

d-Matrix 成立于2019年,迄今已融资约5亿美元,估值约为20亿美元。微软是其投资者之一,通过旗下风险投资机构M12进行投资。

历经过去几年的发展,大家都意识到,人工智能推理有望成为最大的单一计算工作负载。毕竟,像 OpenAI 这样的 AI 服务提供商长期以来一直声称,他们的主要瓶颈在于计算资源的可用性。即使这些公司正在建设庞大且耗电量巨大的数据中心来运行训练和推理工作负载,对优化的硬件和软件解决方案的需求依然存在。

不过,这些应用在内存墙方面带来的挑战显而易见。于是,D-Matrix正通过摒弃传统的GPU架构来应对这一挑战。与许多同行仅仅依靠原始浮点运算能力(FLOPs)竞争不同,D-Matrix的Corsair平台采用了一种异构架构,旨在突破内存瓶颈。

正如d-Matrix首席执行官Sid Sheth在年初的一次采访中所说,他很幸运没有成为大约十年前第一批人工智能芯片公司中的一员。当时,卷积神经网络(CNN)是最先进的技术,大多数人认为视觉加速和类似的工作负载是这些芯片的杀手级应用。但当Sheth和Sudeep Bhoja在2019年创立d-Matrix时,他们很快意识到,他们不想仅仅成为又一家计算机视觉加速器。

Sheth表示,到2019年,英伟达实际上已经赢得了培训领域的霸主地位。“除非你拥有显著的差异化优势,否则试图在这个领域有所作为是徒劳的,”他说。

相反,团队决定思考,如果从零开始构建一个全新的、高效的推理硬件平台,它会是什么样子。当然,D-Matrix 并非首家这样做的公司。毕竟,谷歌已经开发了好几代张量处理单元 (TPU),AWS也推出了 Trainium 芯片(尽管名称如此,但现在也针对推理进行了优化)。

d-Matrix团队决定重点研究计算核心和内存之间的连接。现代大型语言模型(LLM)需要大量的计算能力和快速的内存访问来生成词元,但将计算和内存分离会引入延迟,并可能造成带宽瓶颈。

“我们知道需要一些特别的东西,一些更高效的东西,一些不仅能解决计算问题,还能解决计算、内存、内存带宽、内存容量以及所有这些问题的东西,”谢思解释说。“如何才能高效地将所有这些功能整合起来,并使其具有可扩展性呢?我们知道需要一些不同的东西,所以我们就开始着手开发它。”

d-Matrix 最终打造的产品与目前常用于运行模型的 GPU 截然不同。从某种意义上说,d-Matrix 的解决方案在连接内存和计算方面,比苹果在其 M 系列芯片中使用的统一内存架构(UMA)更为激进。UMA 将内存和计算集成在单个芯片上,CPU 和 GPU 共享这块内存。

对于基于Transformer的推理而言,瓶颈很少在于计算,而在于权重的移动。D-Matrix通过其数字内存计算(DIMC)技术解决了这个问题,该技术使矩阵乘法直接在存储单元内进行。

“在我们的例子中,存储块和计算块并不是分离的。存储块本身就是计算块。我们基本上在存储单元内部完成所有的矩阵乘法运算,然后使用嵌入在存储阵列中的加法器树来进行求和,”Sheth解释道。

通过使用芯片组方法,d-Matrix 可以根据需要扩展这些 DIMC 单元,并由基于 RISC-V 架构的控制核心管理整体数据流。

“那套架构是一次大胆的尝试,”谢思说道。构建这种新型计算架构耗时数年。团队在整体设计方案上几经调整,最终确定了目前的方案。利用芯片间互连的芯片组来更好地扩展解决方案,也是这一过程的一部分。

正如 Sheth 强调的那样,这种芯片组方法不仅能让公司根据客户需求扩展其解决方案,还能在新型模型架构突然流行时快速应对工作负载的变化。

打开网易新闻 查看精彩图片

据介绍,d-Matrix 的 Corsair 是一款以 SRAM 为中心的 AI 加速器,旨在通过将计算能力与大容量片上内存池相结合,实现低延迟推理。单张 Corsair 卡包含高达 2GB 的片上 SRAM,并提供高达 150 TB/s 的内存带宽——这使其在对内存带宽敏感的推理阶段尤为引人注目。

按照他们所说,生成式推理本质上受限于内存。d-Matrix 采用新型 DIMC 架构,将内存和计算紧密集成,突破了内存带宽的限制。d-Matrix 利用 DMX Link 实现封装内芯片间的高速、节能的芯片间互连,并利用 DMX Bridge 连接两张卡上的封装,从而实现扩展。d-Matrix 是业内首批原生支持块浮点数值格式(现已成为 OCP 标准,称为微扩展 (MX))的芯片之一,可显著提高推理效率。这些业界首创的创新技术与 d-Matrix 的 Aviator 软件栈无缝集成,为 AI 开发人员提供熟悉的用户体验和工具。Corsair

采用业界标准的 PCIe Gen 5 全高全长卡规格,卡对之间通过 DMX 桥接卡连接。每张 Corsair 卡均配备 DIMC 计算核心,峰值计算能力达 2400 TFLOPS(8 位),集成 2 GB 高性能内存,并支持高达 256 GB 的片外扩展内存。DIMC 架构提供高达 150 TB/s 的超高内存带宽,远超 HBM。Corsair 可提供高达 10 倍的交互速度、3 倍的总体拥有成本 (TCO) 性能提升以及 3 倍的能源效率提升。

一款超低延迟推理的AI网络加速卡

在去年九月,d-Matrix 发布了一款名为 JetStream 的定制网卡,该网卡从设计之初就旨在支持数据中心的高速、超低延迟 AI 推理。

从表面上看,JetStream 是一款相当标准的 PCIe 5.0 网卡。它支持两个 200 Gb/s 的端口或一个 400 Gb/s 的端口,并通过标准以太网运行。

据首席执行官 Sid Sheth 称,这家初创公司曾考虑使用英伟达等厂商的现成网卡,但公司研究人员对这些网卡的延迟表现并不满意。因此,他们选择使用现场可编程门阵列 (FPGA) 设计自己的网卡,该网卡功耗约为 150 瓦。更重要的是,d-Matrix 声称其网卡能够将网络延迟降低至仅两微秒。

其中两块网卡设计用于与芯片供应商的最多八个 600 瓦 Corsair AI 加速器配对,拓扑结构类似于以下所示。

定制的 ASIC 芯片性能也不逊色,每张卡在使用 MXINT8 数据类型时能够产生 2.4 petaFLOPS 的运算能力,而使用精度较低的 MXINT4 数据类型时则能够产生 9.6 petaFLOPS 的运算能力。

打开网易新闻 查看精彩图片

d-Matrix 参考设计采用一张 JetStream I/O 卡,最多可为四个 Corsair AI 加速器提供服务。

d-Matrix 的内存层次结构将相当大量的超高速 SRAM 与速度慢得多但容量更大的 LPDDR5 内存(与高端笔记本电脑中常见的内存相同)相结合。

每张 Corsair 显卡都包含 2GB 的 SRAM,读写速度可达 150 TB/s,以及 256GB 的 LPDDR5 显存,读写速度可达 400 GB/s。为了更直观地理解这些数字,一块 Nvidia B200 显卡提供 180GB 的 HBM3e 显存和 8TB/s 的带宽。

需要提醒的是,AI 推理通常是带宽受限的工作负载,这意味着内存速度越快,生成令牌的速度就越快。

打开网易新闻 查看精彩图片

“根据客户希望在速度和成本之间做出的权衡,他们可以选择运行模型所需的内存类型,”Sheth 说。

每个节点配备 2 TB 的 LPDDR5,足以运行数万亿个参数的 4 位精度模型,但总内存带宽为 3.2 TB/s,速度不会很快。

为了获得最佳性能,d-Matrix 建议将模型完全运行在 SRAM 中。但由于每个节点都配备了 16GB 的超高速片上内存,因此想要运行更大、更强大的模型的用户需要大量的系统。d-Matrix 估计,每个机架配备八个节点,可以运行参数量高达约 2000 亿、精度达到 MXINT4 的模型;如果扩展到多个机架,则可以运行更大的模型。

而这正是d-Matrix JetStream I/O卡的设计初衷。d-Matrix结合了张量并行、专家并行、数据并行和流水线并行等多种技术,最大限度地提升了这些机架级计算集群的性能。

在这些系统中,两个 JetStream 网卡的总带宽仅为 800 Gb/s,d-Matrix 似乎采用了与我们迄今为止在 GPU 系统中看到的类似的策略,利用张量并行性将模型权重和计算工作负载分配到节点的八个加速器上,并结合流水线并行性或专家并行性,将计算扩展到多个节点或机架。

其结果有点像一条推理流水线,模型被分解成若干块,然后按顺序逐个节点进行处理。

每个节点配备 16GB SRAM,这意味着你需要大量的节点,甚至可能需要多个机架才能在 Corsair 的高速内存层上运行更大的型号。

dMatrix联合创始人兼首席执行官Sid Sheth表示:“JetStream网络技术的推出正值人工智能走向多模态化,用户对交互速度提出极高要求之际。通过JetStream,结合我们此前发布的Corsair计算加速器平台,d-Matrix正在为人工智能的可扩展性和极速发展开辟一条前进之路。”

Sheth 表示,现在公司正在创新研发有助于解决内存和计算瓶颈的显卡,接下来将着手解决下一个最大的问题:网络连接。

JetStream 是一款全高 PCIe Gen5 网卡,可直接插入数据中心服务器的标准端口,最高传输速度可达 400 Gbps。它与市面上常见的以太网交换机兼容,无需更换硬件或构建额外的基础设施即可轻松部署到数据中心。

d-Matrix产品副总裁Sree Ganesan解释说:“我们不想在与生态系统的接口方面搞得太复杂,我们希望它符合标准。我们的客户一直在问:能否直接与数据中心现有的设备即插即用?我们的回答是:可以,您可以继续使用您现有的标准以太网交换机。”

该公司表示,结合其 Corsair 加速器和 Aviator 软件,这款新显卡与基于 GPU 的产品相比,速度可提升 10 倍,性价比可提升 3 倍,能效可提升 3 倍。

加入了NVLink Fusion生态

在今年九月,d-Matrix 宣布与 NVIDIA 达成全新合作,其中包括一项多年产品路线图,旨在将 d-Matrix XPU 引入广泛部署的 NVIDIA AI 工厂生态系统。此次合作的核心是一个支持 NVLink Fusion 的机架级系统,AI 实验室、超大规模数据中心和新型云平台可以无缝部署该系统,从而提供超低延迟的高级令牌服务。

作为 NVIDIA NVLink Fusion 的合作伙伴,d-Matrix将与 NVIDIA 紧密合作,将 d-Matrix 的下一代推理 XPU(首先是Raptor™)直接集成到最新的 NVIDIA 机架参考架构设计中。该架构采用 NVIDIA Vera CPU、NVIDIA NVLink 交换机、NVIDIA BlueField-4 DPU、NVIDIA ConnectX-9 SuperNIC 和 NVIDIA Spectrum-X 以太网网络。d-Matrix 还与 NVIDIA NVLink Fusion 生态系统中的连接解决方案领导者 Astera Labs 合作,提供定制解决方案,以确保整个系统实现高吞吐量、无缝的数据流。基于 MGX 平台的 d-Matrix 机架将采用模块化无线缆托盘,这些托盘采用 NVIDIA 成熟可靠的 MGX 生态系统和供应链构建,可实现快速无缝的部署。

NVLink Fusion为 d-Matrix 提供了一个成熟、高带宽、低延迟的可扩展基础架构,用于将 d-Matrix XPU 连接到 NVIDIA 机架级基础设施。借助 NVLink Fusion 和 MGX 生态系统,d-Matrix 可以基于 NVIDIA 平台通用的机架架构、网络和供应链进行构建。此次合作的第一步是将 d-Matrix Raptor XPU 接入 NVIDIA MGX 机架,从而为客户带来更高的性能、更大的部署灵活性以及可扩展的架构,以便随着需求的增长扩展基于 Raptor 的推理集群。

d-Matrix创始人兼首席执行官Sid Sheth表示:“与NVIDIA的此次合作是我们迈向无限推理、人人可享的征程中的一个重要里程碑。通过NVLink Fusion集成到NVIDIA最新的MGX机架级基础设施中,意味着我们的客户可以将我们的推理XPU与广泛应用的NVIDIA AI Factory平台并肩部署。这正是d-Matrix一直致力于构建的未来——超低延迟、高能效的推理XPU和GPU在机架级规模下协同工作,从而提供卓越的AI体验。”

“NVLink Fusion 使合作伙伴能够将定制芯片与 NVIDIA 丰富的 NVLink 生态系统、先进封装、机架级系统和网络技术集成在一起,”NVIDIA 创始人兼首席执行官黄仁勋表示。“随着 NVIDIA AI 基础设施部署在全球云端和本地数据中心,NVLink Fusion 为像 d-Matrix 这样的合作伙伴提供了一条与 NVIDIA 计算平台无缝集成的途径,从而为构建下一代 AI 工厂的客户扩展了加速器选择范围。”

Astera Labs首席执行官Jitendra Mohan表示:“专用连接是将创新计算转化为高性能AI工厂的关键。我们与d-Matrix和NVIDIA的合作,在NVLink Fusion生态系统中实现了这一愿景,为低延迟AI推理提供了高吞吐量。”

英伟达计划投资 d-Matrix,背后反映的是 AI 芯片竞争逻辑的变化:随着大模型从训练走向规模化推理,市场对芯片的需求不再只是追求更高的算力,还包括更低的推理成本、更短的响应延迟和更高的能效。针对特定任务设计的专用芯片,正在成为 GPU 之外的重要补充。对英伟达而言,与其让这些芯片成为独立的竞争力量,不如主动推动它们融入自己的技术体系。

d-Matrix 的价值在于采用不同于传统 GPU 的计算架构,尝试通过存算融合减少数据搬运开销,提升特定 AI 推理任务的效率。双方此前已推进产品与英伟达 NVLink Fusion 架构的整合。如果合作顺利,d-Matrix 的芯片就有机会在英伟达主导的数据中心体系中承担部分推理任务,而英伟达则可以继续发挥其 GPU、互连和系统平台的优势。

更深一层看,英伟达正在尝试将竞争从单颗芯片延伸至整个 AI 计算系统。未来,即使部分工作负载转向专用推理芯片,英伟达仍希望通过高速互连、软件协同和系统集成保持自身的产业地位。这既是对异构计算趋势的主动布局,也是对客户自研芯片和降低 GPU 依赖趋势的一种应对。

对 d-Matrix 来说,与英伟达合作则有助于降低进入数据中心市场的门槛,加快产品商业化。不过,这笔潜在投资并不意味着英伟达认可或将全面采用 d-Matrix 的技术,更不能说明专用推理芯片已经能够取代 GPU。 真正值得观察的是,双方能否将技术兼容转化为实际部署,以及这种合作能否在提升推理效率的同时,为双方创造可持续的商业价值。

*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。

今天是《半导体行业观察》为您分享的第4554期内容,欢迎关注。

加星标⭐️第一时间看推送~

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

求推荐

打开网易新闻 查看精彩图片