公众号记得加星标⭐️,第一时间看推送不会错过。

DRAM供货压力和合约价格持续上涨,反映出生成式AI对高性能存储的巨大需求。超大规模数据中心的扩张进一步加剧了这一压力,目前数据中心已消耗全球DRAM产量的相当大一部分。

在本研究中,我们提出了一种新架构:光纤存储器(Fiber Memory),它重新构想了光纤在超大规模数据中心中的作用,将其部署为一种主动式、循环延迟线存储器,用于存储不可变数据,例如大语言模型(LLM)权重。

我们提出了一种考虑光纤物理现实的数据并行光广播延迟线存储架构。通过结合空分复用多芯光纤(MCF:multiplexed multi-core fibers)、无源光分路放大接口、共封装光学(CPO)和区域全光再生,我们的案例评估表明,与传统的HBM3e配置相比,光纤存储器可以消除10,000个AI加速器上的冗余权重存储,并将权重传输能耗降低超过70%。

打开网易新闻 查看精彩图片

引言与研究动机

存储器是运行大语言模型(LLM)的现代计算集群中的瓶颈。传统硬件平台依赖将高带宽存储器(HBM)或双倍数据速率(DDR)DRAM直接堆叠在处理器旁边,以将数十亿模型参数输入计算流水线。这种范式导致DRAM需求激增,从而造成供应紧张、成本高昂,以及超大规模数据中心内热管理和功耗的限制。在本研究中,我们提出了一种新范式——将光纤网络用作存储器,以避免不必要的数据复制。

见解 1:在数据中心内,DRAM 内存中的数据冗余极其低效;

试想:在一个超大规模数据中心中,服务于同一个LLM的所有节点上都复制着相同的模型参数(例如注意力机制和多层感知机MLP权重)。不仅模型参数被大量复制,更糟糕的是,对这些复制数据的访问(请求-响应)也由每个服务于同一模型的节点以完全相同的方式执行。复制导致了过度的能量消耗。

见解2:光纤即存储;

超大规模数据中心中光纤的绝对数量(10,000到100,000公里光纤线路)在任何时刻都承载着海量的比特数据。一个跨越数据中心的简单光纤环路,其容量可达数TB,数据以光速的2/3(c)在环路中流经每个计算节点。实际上,我们可以将光纤转变为延迟线存储器——这是电子计算机最早使用的存储器类型之一,尽管与20世纪40年代和50年代初的水银延迟线存储器相比,它在速度、容量和长度上都有了巨大的提升。与其让数千个节点消耗本地电能从HBM或DDR中获取相同的权重,不如由一个集中式光发射器将模型参数一次性注入共享光纤网络。推理节点被动地"分接"光纤中持续循环的数据,即时提取权重,从而消除整个集群中的冗余权重存储和获取能耗。

我们的方案得到了日益普及的共封装光学(CPO)技术的支持,该技术将硅光引擎直接集成在处理器基板上,从而绕开了高功耗的电收发器。在共封装光学中,硅开关芯片和光引擎(硅光芯片)被放置在同一个封装基板上。电信号只需传输毫米级距离而非厘米级,从而避免了消耗光-电转换大部分功耗的数字信号处理单元。这一能力消除了在RAM中缓冲的需求,并实现了将数据直接馈入计算单元的可能性。

现有的最先进数据中心网络硬件也致力于最小化数据传输成本,但仍然基于中间缓冲。例如,NVIDIA的NVNe-tIO SmartNIC接收传入网络数据包,并利用GPUDirect RDMA将原始数据直接流式传输到GPU的VRAM;一些FPGA SmartNIC讲数据短暂缓冲在数据流水线寄存器、小型FIFO或FPGA块RAM中。然而,在我们的方法中,我们力求不仅消除对不可变数据的存储需求,还消除数据在到达计算单元途中的任何缓冲需求。

在这项工作中,我们:

(1) 证实了将数据中心光纤用作AI加速器高速延迟线存储器的可行性。

(2) 勾勒出一种利用多芯光纤、无源分路器和光放大器的光网络架构,无需电子转换即可分发权重数据流。

(3) 详细描述了数据表示、对齐和交织策略,以实现从光纤直接馈入处理脉动阵列。

(4) 提供了与标准HBM系统相比,Fiber Memory在性能、延迟和能耗方面的定量评估。

光纤作为存储器

光纤"传输过程中"存储数据的能力由带宽-延迟积(BDP)决定。光在标准二氧化硅光纤中的传播速度(v)由下式给出:

其中n ≈ 1.5是光纤芯的折射率。长度为L的光纤线路的总传播延迟(τ)为:

打开网易新闻 查看精彩图片

如果发射器以总数据速率B对光进行调制,则任何单一时刻存储在光纤线缆内部的数据总量M为:

将超大规模数据中心光纤线缆的路由长度汇总,得到光纤总长度(L)在10,000到100,000公里之间。使用超密集波分复用(WDM),单条商用光纤可以达到约100 Tb/s(12.5 TB/s)的总带宽(B)。将这些参数代入BDP方程,可以揭示网络巨大的潜在存储能力。对于100,000公里的光纤总长度,存储容量为:

打开网易新闻 查看精彩图片

这个容量足以在飞行状态中完整存储多个大规模LLM(例如量化为INT8或FP16的1万亿参数模型)。

打开网易新闻 查看精彩图片

图1:Ring与Pod架构。权重服务器将模型参数注入波分复用的19芯MCF环。区域分路器将信号广播到各个独立的Pod,从而最小化累积损耗和本地收发器开销。

打开网易新闻 查看精彩图片

图2:非对称分路放大接收器示意图。无源1:99分路器提取1%的信号功率用于本地执行,同时让99%的信号通过。区域PDFA在Pod级别恢复信号幅度,最小化有源器件数量。

虽然这个例子展示了单条光纤的基本潜力,但我们的完整光纤存储架构聚合了多束多芯光缆以实现更高的总带宽和容量。我们利用空分复用的19芯多芯光纤(MCF)。将19个独立纤芯封装在单个物理玻璃包层内,共享一个保护套,使我们将延迟线的空间占用压缩了90%以上,从而使得1000公里环路的物理安装在标准数据中心线槽内高度可控。

为了利用这种传输途中的存储能力,同时保持物理可实现性,我们将光网络组织成Ring和Pod架构(图1)。中央权重服务器将权重存储在非易失性存储器中,并在启动时将权重写入光纤环。区域无源光分路器随后将光信号广播到不同的本地"Pod"(每个Pod包含10个推理机箱)。在每个Pod内部,信号沿着本地化分配总线运行。

传统网络收发器采用点对点模式:它们接收光信号,将其转换到电域(O-E),处理或路由,然后重新调制回光信号(E-O)。这个O-E-O周期非常耗能,并引入数百纳秒的数字处理延迟。相反,我们的架构使用无源、高度非对称的"分路放大"接口。如图2所示,每个机箱使用1:99无源光分路器对传入的本地分配总线进行分路。

- 分支A(分路):将极小部分光功率(1%)直接引向本地AI加速器上的共封装光接收器。由于分路器到硅光电探测器的距离仅为毫米级,这种分路几乎是瞬时的,且不引入电子缓冲。

- 分支B(环路):将剩余光功率(99%)引导回本地总线,继续向下游机箱传播。使用高度非对称的1:99分路器确保每个机箱的通路插入损耗极小。

为了放大这些O波段(1310 nm)的多波长WDM信号流,我们采用掺镨的光纤放大器(PDFA)。PDFA利用掺杂Pr³⁺离子的氟化物玻璃基质,在1280–1330 nm窗口内提供宽频、稳定的增益。重要的是,PDFA具有较长的上能级寿命(约110 μs),使其不受多波长设置中困扰半导体光放大器(SOA)的通道间交叉增益调制(XGM)和快速增益饱和的影响。

这使我们每个Pod每条线缆只需部署两个PDFA(一个前置放大PDFA在Pod头部,一个在线前置放大PDFA)即可补偿所有分路、分接和光纤损耗。

PDFA直接在光域中放大光载波,避免了O-E-O转换。PDFA的延迟仅由通过掺杂氟化物光纤段(通常小于15米)的飞行时间决定,小于75 ns。区域部署的全光2R再生(再放大和再整形)可在没有电转换的情况下抑制噪声累积。

数据并行机箱架构。我们将基础网络"节点"定义为一个8加速器组成的底板机箱(类似于NVIDIA HGX等标准密集计算平台),而不是单个单片芯片。整个机箱接收完整的14线缆MCF束(承载所有256个有源纤芯),使机箱能够同时摄取整个128 GB模型数据流。这保证了每个机箱100%独立,可以完成端到端推理,而无需通过后端网络传输激活数据。

然而,将256根物理光纤端接到单个硅芯片上会带来严重的制造和热挑战。为了解决这个问题,我们将256个光学纤芯在机箱板上的8个加速器之间进行物理分配。每个单独的加速器封装只物理分接一个32芯的子组。在每个加速器的本地PIC内部(图3),一组硅微环谐振器(MRR)对每个纤芯仅解复用8个波长。这限制了片上接收器接口总共只有256个MRR(32芯×8波长),利用当前的硅光封装技术,这具有高度可制造性、热稳定性和商业可行性。

打开网易新闻 查看精彩图片

图3:共封装光学(CPO)加速器集成。光子集成电路(PIC)与计算硅位于同一中介层上。无源微环谐振器(MRR)对来自32个MCF纤芯的光波长进行解复用,并将原始权重参数直接馈入脉动阵列寄存器。

大规模LLM推理

LLM的执行在内存访问模式上具有高度不对称性。在推理的自回归解码阶段,加速器一个接一个地顺序生成token。对于每个生成的token,处理器必须从内存中读取完整的模型权重集(W),而激活数据(A)主要由前序token的键值(KV)缓存组成。

对于中小批量的任务,权重的体量远远超过激活数据的规模。在典型工作负载中,模型权重占用了总内存带宽消耗的90%到99%。例如,为了在700亿参数模型(FP16,140 GB大小)中生成单个token,GPU必须将整个140 GB参数加载到其寄存器中,而激活和KV缓存传输总量不到1.4 GB。

打开网易新闻 查看精彩图片

图4:流式权重数据包的结构。该数据包以锁定同步前导码开始,随后是包含层ID和缩放因子的FEC保护头,然后是包含原始权重元素的有效载荷(展开以映射到加速器的空间阵列),以及一个循环冗余校验。

由于LLM推理受内存带宽限制,性能受限于权重从HBM传输的速度。在我们的范式下,我们将激活数据和KV缓存放入加速器上的小型本地DRAM或高密度SRAM,同时从光纤流式传输100%的庞大权重数据。

由于权重是从光纤连续接收的,计算单元必须与传入的光脉冲同步执行矩阵向量乘法。标准处理器使用内存地址请求数据,但光纤存储运行在基于推送的确定性流模型上:加速器只需等待所需层参数流过光分路器。

为了结构化这个数据流,权重被打包成流式权重数据包(SWP:Streamed Weight Packets ),如图4所示。每个SWP包含以下部分:前导码——一种高度独特的光脉冲模式,允许接收器的时钟和数据恢复(CDR)电路锁定到传入数据相位;帧头——包含节点从操作抖动和停顿中恢复所需的信息,利用复制机制,并保护量化缩放因子;有效载荷——原始权重矩阵元素(Wᵢ),专门格式化为匹配脉动阵列的处理布局;CRC——用于最终数据包边界验证的尾部循环冗余校验字段。

由于权重矩阵直接从分路器读入执行寄存器而无需本地缓冲,权重服务器预先展开矩阵布局,从而消除了加速器上复杂的地址转换、行解码或布局变换的需求。

延迟线系统的一个主要挑战是协调单个节点的处理速率与恒定速度的光学数据流。如果节点因大批量处理或长时间的KV缓存查找而落后,它可能会错过下一个权重数据包的开头,从而被迫等待整个环路周期(τ)以使权重重新出现。为了构建鲁棒性和调度灵活性,权重服务器可以实现交错复制和填充。如图5所示,我们可以在层数据包之间使用容隙空间(空的光载波窗口或高频空闲模式),为节点提供安全余量,使其在下一层有效载荷开始之前完成其激活和KV缓存的内存交换。此外,我们可以在物理环内的多个点复制和交错权重,减少节点开始新推理周期的最坏情况等待时间。然而,容隙空间和交错都会缩小光纤网络的有效存储容量。

打开网易新闻 查看精彩图片

图5:交错与填充比较。在情况A中,连续的层参数紧密排列;轻微的计算延迟导致节点错过第N+1层。在情况B中,包含空或冗余的容隙空间允许具有操作抖动的节点安全地同步和解码传入数据流。

Llama-3-70B 定量案例研究

为了在物理一致且实际的设计约束下评估我们的架构,我们分析了一个运行700亿参数密集模型(Llama-3-70B)的集群部署,该模型量化为INT8(70 GB占用)。

我们配置系统如下:模型大小(W)——1个模型=70 GB(INT8),光纤总容量扩展到128 GB,以容纳时序容隙空间和冗余层副本。该设计中高达45%的容隙空间用于容纳与较长上下文长度相关的注意力延迟增加。集群大小——1,250个独立的8加速器机箱(总计10,000个加速器),组织成125个区域Pod(每个Pod 10个机箱)。

空分复用盘绕(Space-Division Multiplexed Spooling):为了以物理一致的延迟存储128 GB(1.024 Tb),我们利用14条并行多芯链路(19芯MCF),其中每条链路由20个级联的标准商用50公里线盘组成。在14根线缆中,这提供了总共266个光学纤芯,留下10个纤芯未分配用于热插拔冗余,保持256个有源纤芯。

直接检测频谱方案(Direct-Detection Spectral Plan):为了消除对高功耗相干DSP的需求,我们利用O波段(λ₀≈1312 nm)中石英光纤的自然零色散窗口。为了防止在1000公里传输中的符号间干扰(ISI),我们使用密集波分复用(DWDM)替代宽带粗波分复用,采用以λ₀为中心的紧密100 GHz(约0.6 nm)通道间隔。256个有源纤芯中的每一个承载8个DWDM通道,运行在50 Gbaud PAM4(每波长100 Gb/s),单芯带宽为800 Gb/s(100 GB/s)。总链路带宽(B)——256个有源纤芯的总带宽为25.6 TB/s(204.8 Tb/s)。

光在1000公里盘绕光纤环路中传播的延迟(τ)为:

打开网易新闻 查看精彩图片

在25.6 TB/s的总带宽下,整个线缆束中飞行中存储的最大数据量M为:

这足以容纳我们的70 GB Llama-3-70B INT8模型,并留下58 GB用于时序容隙和交错数据包副本。

通过采用纯数据并行机箱模型,完整的25.6 TB/s模型带宽被路由到每个机箱。内部,256个纤芯被划分到8个本地处理引擎中。因此,每个单个本地加速器芯片处理的权重传输带宽为:

打开网易新闻 查看精彩图片

这与定位高端AI处理引擎的典型内存带宽相匹配(例如,NVIDIA H100具有3.35 TB/s HBM3),并完全在标准硅光学的能力范围之内。

我们将直接检测模型与标准HBM3e基准进行比较。我们每个节点提供25.6 Tb/s的权重吞吐量,与配备两个1.6 TB/s HBM3e的AI加速器封装相当。使用4.0 pJ/bit作为HBM3e本地内存读取的实际能耗指标,10,000个传统HBM3e集群节点的权重传输功率为:

这个1024 kW的计算代表了假设连续峰值带宽利用率的理论最大值。尽管实际推理工作负载会遇到计算微停顿,略微降低动态读取速率,但我们有意忽略了大规模HBM3e集群固有的大量静态泄漏和刷新功率开销,使基准保持保守平衡。此外,虽然Fiber Memory完全消除了权重传输的能耗,但节点仍将消耗一小部分本地能量来访问片上SRAM或高密度DRAM,以满足激活数据和KV缓存所需的其余1%到10%的内存带宽。

中央发射器与激光器:我们调制256个有源纤芯×8个通道=2,048个激光器。在每激光器100 mW光功率和O波段分布反馈(DFB)激光器插头效率5%的条件下,中央激光源功耗为:

打开网易新闻 查看精彩图片

中央延迟线放大:1000公里环路需要在每个50公里线盘之间进行在线放大,以防止信号完全消失。14根线缆各20级,我们部署280个在线PDFA,每个25 W:

O波段PDFA与全光2R再生器:125个Pod路由完整的14线缆束,我们在每个Pod中为每条线缆部署2个PDFA(一个前置放大和一个在线)和1个区域全光2R再生器。PDFA提供光学再放大(1R),每个放大器需要25 W电功率。我们采用配置为交叉相位调制的非线性半导体光放大器(SOA)进行全光再整形(2R),消耗4 W用于热偏置:

打开网易新闻 查看精彩图片

本地IM-DD PIC接收器、均衡器与FEC:通过利用直接检测PAM4而非相干技术,我们绕过了高功耗ADC和大型相干DSP。短距离接收器电子器件以0.7 pJ/bit的聚合能耗运行:

其它开销:适度的冷却风扇、监控光电二极管和控制电子器件相对于主要项来说可以忽略不计。我们估计总P_overhead = 5,000 W。

将这些项相加得到光纤存储器的总功耗:

打开网易新闻 查看精彩图片

比较基准模型和光纤模型,Fiber Memory在整个集群中实现了总权重传输功率72.1%的降低(284.8 kW对比1,024 kW),同时完全消除了在本地HBM3e堆栈中存储700 TB复制静态模型权重的静态泄漏功率、冷却开销和高昂资本支出。

挑战与物理约束

部署多公里循环光纤存储器需要仔细管理光纤的物理限制。

光纤衰减与分路器损耗。在我们的多芯光纤中,工作在O波段(1310 nm)的标准单模纤芯的物理损耗约为0.32 dB/km。如前文所述,1:99本地分路器引入的通路插入损耗仅为0.043 dB。对于Pod中的10个机箱,累积分路损耗仅为约0.43 dB。一个PDFA提供+20 dB到+30 dB的增益。连接连续50公里光纤段的PDFA位于每个Pod的输入端,补偿分布分路和线路损耗;放置在Pod分配总线中间的PDFA抵消分路器和本地传播损耗。

放大与O波段放大器噪声累积。光放大器会引入放大自发发射(ASE)噪声。每个放大步骤都会通过添加随机相位和幅度波动来降低光信噪比(OSNR)。ASE噪声的累积限制了信号在变得不可读之前能够传播的距离。N个级联放大级后的OSNR可以通过标准分析模型近似:

打开网易新闻 查看精彩图片

其中P_in是输入信号功率,G是放大器增益,n_sp是掺镨氟化物纤芯的自发发射因子,hν是1310 nm处的光子能量,Δν是光带宽。为了将OSNR维持在低误码率检测所需的阈值以上——对于50 Gbaud PAM4格式通常需要>15 dB,以使前向纠错前的BER保持在可接受限值以下——我们必须限制连续的模拟放大步骤。主要的ASE噪声贡献者是连接20个50公里干线段的在线PDFA(每个需要放大器增益G≈16 dB以补偿0.32 dB/km的O波段衰减)和为10机箱Pod服务的分配放大器。使用这些物理增益参数评估OSNR近似值后发现,信号在通过级联干线段和本地1:99机箱分路器后接近15 dB阈值。我们在Pod级别将数据流路由通过区域全光2R再生器(再放大和再整形)以防止信号退化。该器件利用非线性SOA或高非线性光纤内部的交叉相位调制,将数据干净地传输到新的光探测光束上,在信号分配给Pod内的100个加速器之前重置OSNR。

色散管理(Chromatic Dispersion Management)。为了消除过度的色散,我们的架构将操作限制在O波段的零色散区域。我们部署了一个具有100 GHz间隔的8通道密集WDM网格,将整个传输限制在以λ₀=1312 nm为中心的窄700 GHz(约4.2 nm)光谱窗口内。通过限制总光谱覆盖范围(Δλ)并将其精确定位在光纤的零色散波长处,我们确保所有有源通道的物理色散系数保持在|D|≤0.1 ps/(nm·km)的范围内,无需主动色散补偿即可最小化脉冲展宽。

前向纠错与LLM容错性。为了最大化昂贵光再生器之间的距离,我们利用直接集成在加速器PIC接收器中的高通量前向纠错(FEC)。低开销的Reed-Solomon或低密度奇偶校验(LDPC)码可以将高达10⁻³的原始输入误码率纠正到干净的10⁻¹²操作标准,延迟开销极小(<100 ns)。

此外,LLM还表现出对微小噪声的鲁棒性。量化的神经网络权重具有高度容错性:只要缩放因子和层归一化保持不变,权重矩阵中随机的单比特翻转对模型输出的影响可以忽略不计。通过对SWP头部和缩放因子特别应用强FEC保护,我们可以容忍原始权重有效载荷中微小、未纠正的比特翻转,从而放宽网络的OSNR和物理收发器要求。

热管理、激光器可靠性与外部光源。硅光芯片对温度变化高度敏感。微环谐振器(MRR)依赖亚微米尺寸来实现波长共振;微小的温度偏移会使折射率发生漂移,导致MRR错过其目标波长通道。此外,激光二极管是任何光学系统中最脆弱的组件。在热的处理器中介层上工作的高功率激光二极管会迅速退化,构成严重的可靠性风险。为了应对这些挑战,我们采用外部激光源。高功率激光器被安置在服务器机架前面板的独立、冷却、热插拔机箱模块中,远离热的加速器芯片。光通过无源光纤引导进入CPO封装。主动热调谐被降级到集成在MRR中的微热电加热器,每通道仅消耗微瓦级功率即可稳定光学对准。

结论与未来展望

我们提出了光纤存储器,这是一种将数据中心光纤网络重新利用为主动式循环延迟线存储系统的新架构。通过在并行空分复用多芯光纤上持续流式传输静态、高度复制的LLM权重,我们绕过了在每个计算节点上部署大规模、冗余的本地HBM或DDR存储块的需求。

我们的分析表明,我们的设计是开发实验原型的一个合理起点。通过同时向数千个推理流水线传送相同的权重参数,光纤存储器可以将权重传输能耗降低超过70%(与HBM3e相比),同时减少数据复制成本。将光纤存储器扩展到更大的模型只需增加50公里光纤段和PDFA的数量,以增加在环路中循环的数据量。我们的工作应被视为一阶架构可行性研究和进一步研究的呼吁,而非最终化的实现蓝图。

未来的工作将研究针对增长上下文的权重插入策略设计、高级同步协议、环形网络是否可以用于系统管理和处理用户查询等标准网络任务,以及能够原生调度混合神经架构以与光速数据流交织的自定义编译器管道。

*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。

今天是《半导体行业观察》为您分享的第4466内容,欢迎关注。

加星标⭐️第一时间看推送

打开网易新闻 查看精彩图片

打开网易新闻 查看精彩图片

求推荐

打开网易新闻 查看精彩图片