公众号记得加星标⭐️,第一时间看推送不会错过。
人工智能行业正经历一场连接性革命。随着人工智能集群的GPU数量从几十个增长到成百上千个,传统网络的物理和架构极限正被推向极限。如今,业界正在部署拥有10万个甚至更多XPU的集群。在如此庞大的规模下,问题不再是我们能否连接更多的计算资源,而是我们沿用的网络设计能否跟上步伐。
多年来,铜缆一直是机架内加速器连接的默认选择,这并非没有道理。它价格低廉、节能高效且可靠。博通支持长达 4 米的铜缆传输距离,是业内其他厂商普遍采用的 2 米的两倍。但铜缆存在物理极限,机架设计也因此不得不做出调整。在典型的混合机架中,计算托架位于顶部和底部,交换机位于中间,因为这就是线缆的传输距离极限。
我们对铜缆的运用已经超越了许多人的预期。如今的机架内扩展系统支持高达 1.04 Pbps 的总带宽。更高密度的背板和更先进的交换机可以将带宽翻倍至 2.08 Pbps,这意味着每个机架可以容纳更多的扩展处理器 (XPU) 和更高的性能。但是,一旦扩展域需要跨越单个机架,就需要寻找替代方案。
向光纤连接的转变彻底改变了一切。光纤链路的传输距离远远超过铜缆2到4米的传输极限,基础设施运营商不再受限于固定的机架配置。解耦式机架架构将计算机架与交换机机架完全分离,使网络运营商能够灵活地根据自身运营需求布置基础设施。
这种灵活性不仅仅是便利,它从根本上重新设计了人工智能基础设施的构建和扩展方式。纵向扩展(连接机架内的GPU)和横向扩展(连接数据中心内的机架)之间的界限日益模糊,而以太网——作为横向扩展和跨向扩展网络的通用标准——现在也能够服务于纵向扩展。
以太网已成为横向扩展和跨向扩展网络的行业标准。一直以来,纵向扩展都是一个悬而未决的问题,而专有互连技术在这方面一直占据主导地位。但我相信,这最后的堡垒也即将瓦解。紧密耦合的人工智能工作负载需要低延迟、无损操作以及高效的小消息处理能力。开放以太网可以同时满足这三点,因此我们不再有理由接受封闭式方案带来的种种弊端。
这并非未来承诺。博通 Tomahawk Ultra 现已量产出货。它提供 51.2 Tbps 的带宽,每个逻辑端口 800 Gb/s 的传输速率,以及低于 250 纳秒的延迟。博通全面的产品组合,包括 Tomahawk、Tomahawk Ultra 和 Jericho 产品系列,支持在单一以太网操作系统模型上进行纵向扩展、横向扩展和横向扩展,并拥有强大的多厂商生态系统支持。
开放标准是确保其长久发展的关键:
SUE-T(Scale-Up Ethernet Transport,可扩展以太网传输)旨在构建高效的内存结构模型,并将传输与计算架构相结合进行设计。
ESUN(面向规模化网络的以太网)提供高可靠性、无损的以太网,并支持高效的多跳拓扑结构。其v1.0规范于2026年初发布,创始成员正在推动行业规范的统一。
业界之所以青睐铜缆,原因很简单:传统光缆成本更高、功耗更大。光计算互连 (OCI) 旨在消除这种权衡。OCI于 2026 年 3 月正式发布,它是一个开放标准,可将扩展域扩展到机架层面。其目标是将光缆的传输距离和灵活性与铜缆的强大性能相结合。OCI 的架构设计旨在使成本和可靠性接近铜缆的关键绩效指标 (KPI)。实际上,运营商可以迁移到完全解耦的设计,而无需牺牲功耗、成本或可靠性。
运营商仍然需要多种选择。博通的架构支持共封装和集成光器件、前面板可插拔组件以及传统的铜质背板。运营商可以权衡功耗、成本和延迟,并为每次部署选择合适的组合。
这一切都离不开硅技术的进步。我们的下一代芯片在带宽和扩展性方面实现了大幅提升,而功耗却没有像以往预测的那样大幅增加。这是我最引以为豪的工程成就,我们自身的测量数据也证实了这一点。
它还为我们进行推理做好准备。随着模型和加速器的多样化,推理服务需要能够适应新硬件的设计,而不仅仅是增加相同 XPU 的副本。开放式的、基于以太网的架构正是为了应对这种变化而构建的。
如今,市场已初步显现出这些成果。目前,已有超过五家超大规模数据中心在生产环境中部署了以太网纵向扩展方案,超过十家合作伙伴正在构建基于以太网纵向扩展的机架。预计未来六个月内,将有多个基于定制和商用 XPU 构建的机架投入生产。
三大趋势正在汇聚:规模化应用领域快速增长,行业正在突破铜缆的极限并开始采用光纤,而OCI的出现将扫清构建基于以太网的开放式光连接AI网络的最后障碍。如今的设计决策将塑造未来十年AI数据中心的格局。
用于人工智能基础设施的集成光学?
激光器、调制器和光电探测器等光学元件传统上都集成在可插拔收发器中,而数字信号处理器 (DSP)、驱动器和跨阻放大器 (TIA) 则通过铜缆互连将信号延伸到机架之外。但随着人工智能工作负载规模空前扩大,连接芯片、服务器和数据中心的物理基础设施正面临极限挑战。超大规模数据中心互连依赖于铜缆和光纤技术的层级结构来连接高性能计算单元,例如 GPU 和 XPU。虽然铜缆长期以来一直是连接高带宽交换机和 XPU 的主要介质,但其链路传输距离正悄然接近极限。
现代人工智能加速器基于先进的中介层封装,其中GPU或XPU芯片与HBM内存和多个I/O芯片并排排列。随着数据速率的提升,从中介层封装中伸出的铜缆连接面临着日益严峻的挑战。串扰和带宽密度开始限制物理通道的数量。铜缆的有效传输距离也随着速度的提升而迅速下降,在100 Gbps时约为4至5米,在200 Gbps时约为2至3米,而在400 Gbps时则不足2米。机架级人工智能的密度如今已将互连需求推高至2米以上,而这恰恰是克服铜缆信号损耗成本最为高昂的临界点。
面向人工智能基础设施的集成光学技术是业界应对这一挑战的解决方案:将光学元件更靠近,最终集成到GPU或XPU芯片旁边的先进中介层上。这样做带来的收益非常显著。在大型人工智能工厂中,仅光网络一项就可能消耗约10%的计算等效功耗;而光器件与芯片之间更紧密的集成可以将网络功耗降低高达3.5倍,一些部署案例甚至实现了60%至70%的降幅。
该行业也在经历人工智能系统架构方式的转变,集成正在四个不同的连接领域中不断推进:
跨域扩展:扩展网络架构,将多个地理位置分散的数据中心无缝集成到一个统一的资源池中,从而将 AI 基础设施扩展到任何单个设施之外。
横向扩展(机架到机架和集群):连接更远距离的机架和集群,其中可插拔收发器、板载光模块 (OBO)、近封装光模块 (NPO) 和共封装光模块 (CPO) 目前相互竞争和共存。
机架内扩展(机架内):将 GPU 连接到单个机架内,业界正在努力寻找方法,通过将共享内存计算扩展到多机架互连和光学器件来扩大单个节点域的大小。
缩放(服务器托盘内/XPU间):虽然业内一些供应商对该领域的定义有所不同,但超大规模数据中心运营商认为它是最紧密、最先进的领域,旨在实现单个服务器托盘上GPU之间的直接光连接,以提高内存访问吞吐量,从而提高计算速度。
铜缆在低数据速率的短距离链路中仍然可行且应用广泛,例如在 3 到 5 米的距离内,其性能可达到 200 Gbps 以下。但当数据速率达到 400 Gbps 及以上时,铜缆的成本、功耗和物理限制开始超过光纤方案,成为传输速率的瓶颈。
随着行业向 400 Gbps 及更高速率发展,集成光器件的优势变得越来越显著:
低延迟互连:随着数据速率的提高,前向纠错的开销也会增加,从而增加每条链路的延迟。在 400 Gbps 的速率下,这种开销可能远大于 100 或 200 Gbps 的速率。采用更简单调制格式(例如 NRZ)的光纤方案可以降低 FEC 开销,与基于高速 PAM-4 的铜缆或光纤链路相比,有效延迟更低:这对于运行推理工作负载的超大规模数据中心而言至关重要,因为在这些数据中心,延迟比成本和功耗更为重要。
显著降低每比特功耗和成本:在 2 米链路上实现 400 Gbps 传输速率时,铜缆方案需要大量的均衡和其他 DSP 补偿技术,这会降低其功率效率,而采用集成光子技术的低功耗光互连方案则能更好地满足需求。此外,在如此高的速度下,铜缆的成本也会急剧上升,这既包括使用更粗的线缆、专用 PCB 材料,也包括链路两端使用功能更强大的 DSP。
更高的带宽密度:电 I/O 受限于芯片边缘,而每毫米带宽会随着单通道速率的提高而趋于平缓,这是由于信号损耗、功耗和串扰造成的。集成光传输通过波分复用技术规避了这一问题,在每根光纤上封装多个通道,从而获得更高的总带宽,预计每毫米边缘带宽可提高 5-15 倍。
实现多代扩展的途径:基于波分复用的光互连提供了一条清晰的扩展路径。与每代都需要全新的调制方案(或更高的数据速率)不同,光互连可以在相同的功率和密度范围内将每个链路的波长数量翻倍甚至更多。这与铜缆的发展路线图形成鲜明对比,后者目前PAM-4信号传输方式的扩展路径尚不明确。
链路稳定性和可靠性:集成光模块减少了数据路径中的物理连接器和线缆组件的数量,每个连接器和线缆组件都是潜在的故障点。多家超大规模数据中心已证实,与可插拔光模块相比,共封装光模块的可靠性提高了 10 倍。此外,测试表明链路抖动次数大幅减少,对于拥有 24K 个 GPU 的集群而言,这意味着效率提升了 90%。
人工智能基础设施的集成光学面临三大主要挑战:
实现与现有铜缆链路在可靠性、功耗和成本方面的平价:多家超大规模数据中心已在生产试验中验证了共封装光器件的可靠性。目前面临的挑战是如何在大规模部署中,在成本、功耗和可靠性方面与铜缆链路保持一致。
生态系统标准化和厂商互操作性:市场厂商采用不同的光调制和传输方案,这些方案彼此之间无法互操作。行业标准组织和多源协议正在努力制定通用规范,以便不同供应商的组件能够协同工作。
先进封装技术的大规模生产:将光学器件应用于高容量数据中心基础设施需要全自动化的制造流程。规模化的良率和吞吐量至关重要,能够展示端到端自动化的供应商将在产能提升方面拥有显著优势。
2026年,OCI-MSA产业联盟推出了一项开放的多厂商光纤互连规范,旨在为超大规模数据中心和竞争供应商提供一个共享的光物理层标准,以便共同构建解决方案。第一代规范支持使用双向(Bi-Di)信号传输200Gbps的带宽,即在同一根光纤上同时传输和接收四种波长、速率为50Gbps NRZ的光信号。双向(Bi-Di)技术提高了光通信系统的效率和容量,并将光纤布线的复杂性和成本降低了50%。第二代规范将单根光纤的带宽翻倍至400Gbps,后续几代规范将继续提升单根光纤的带宽,并有望通过WDM路线图将带宽扩展至3.2Tbps甚至更高。
重大基础设施变革的普及往往遵循着类似的模式:早期的怀疑态度逐渐被对超大规模数据中心的依赖所取代,进而推动企业和托管数据中心更广泛地采用该技术。预计随着这种普及的持续,该技术将日趋成熟,并使集成光器件能够被涵盖多代产品的广泛多厂商生态系统所接受。
(来源:编译自博通)
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。
今天是《半导体行业观察》为您分享的第4555期内容,欢迎关注。
加星标⭐️第一时间看推送~
求推荐
热门跟贴