AI训练集群的交换机端口密度,这几年提升得很快。一台51.2T的交换机,在2U的空间里可以提供64个800G端口,单机的光纤芯数已经达到千芯量级,一个机柜、一排机柜乘上去,数字更大。密度上来之后,光纤布线要面对的问题,和过去以万兆、百兆为主的机房相比,已经有不少差别,涉及芯数、连接器、损耗预算、走线空间和检测方式等多个方面,下面逐项梳理。
一、端口密度提升带来的芯数与线缆规模变化
先看一组简单的数字。400G-DR4每个端口使用8芯,800G-DR8每个端口使用16芯,一台配置64个800G端口的交换机,如果全部采用DR8,接口侧的光纤芯数就是64×16,共1024芯。同样规格的交换机如果换成100G的SR4,每个端口只占8芯,机柜的芯数要少得多。速率从100G到800G,并行光纤的数量和端口数量同时增加,芯数的增长是叠加式的。
芯数增加以后,主干光缆也随之变粗,常见的预端接主干光缆规格从24芯、48芯,延伸到144芯、288芯甚至更高,同一条桥架里承载的光纤数量成倍增长。为了控制线缆外径,光纤本身也在缩径,标准的涂覆层直径为250 µm,缩径光纤把它降到200 µm,包层仍是125 µm,同样的外径可以容纳约1.5倍的芯数。与之配套的是抗弯曲光纤,单模常用ITU-T G.657.A2,最小弯曲半径可以到7.5 mm,多模也有对应的抗弯型号,狭小空间内的转弯更从容一些。
二、连接器形态与接口选型的变化
传统的MPO-12在800G时代不再是唯一选择。DR4使用MPO-12里的8芯,DR8要用MPO-16,两者的外形相近,键位设计不同,不能互相插接。也有厂商采用两个MPO-12的组合来承载800G的两个400G通道,具体取决于模块的接口定义。24芯的MPO常见于主干和转接环节,用来提高单个端口的芯数利用率。
面板空间有限,超小型连接器逐渐受到关注,包括CS、SN这类双芯连接器,以及MMC、SN-MT这类多芯连接器。CS和SN的双芯尺寸只有传统LC双工的一半左右,多芯的MMC厂家给出的数据是同样面板空间下芯数可达传统MPO的数倍,具体数值以产品资料为准。
三、损耗预算与极性管理的变化
速率越高,可容纳的损耗越有限。400GBASE-DR4的信道插入损耗上限约为3.0 dB,800GBASE-DR8同样在3 dB左右的量级,多模方面,100GBASE-SR4在OM4上100 m的预算仅为1.9 dB。单模链路里,光纤本身的衰减只有0.35 dB/km,500 m的光纤损耗不足0.2 dB,预算主要被连接点占用。低损耗MPO的单个配对点损耗按0.35 dB计算,三个连接点就是1.05 dB,四个连接点就到了1.4 dB,再加上熔接和光纤本体,余量已经不多了。
因此密度提升之后,链路里的连接点数量需要精打细算。主干、配线架、跳线三段式的传统结构,在800G速率下往往被压缩成两段,中间的转接环节减到最少。极性也是需要提前确定的一项,依据TIA-568.3-D,并行光学链路一般采用方法B,也就是让一端的发射通道对准另一端的接收通道,MPO-16同样适用这一原则。主干、转接模块和跳线各段的极性类型要统一,一旦在某一环节混用了不同方法,就会出现链路不通的情况,规划时把极性方案写进设计文件,后续施工和维护都会顺利很多。
四、走线空间、弯曲半径与散热
芯数增加之后,桥架和线槽的填充率是首先要核算的量。工程上常见的做法是把线槽的填充率控制在50%以内,给后续的扩容和检修留出空间,光缆的静态弯曲半径一般不小于外径的10倍,敷设过程中的动态弯曲半径则按20倍左右考虑。光缆越粗,弯曲半径越大,机柜侧面的转弯位置需要留足空间,这一点在密集布线的机柜里尤为明显。
线缆布放和机房散热之间也有关联。风冷机柜里,交换机前部的进风口和后部的出风口,如果被大量光缆遮挡,气流会受到影响,端口模块的温度随之升高,800G光模块单个功耗接近15 W,64个端口的总热量接近1 kW,对气流的依赖很强。理线架、走线槽的位置,要避开进出风的路径,光缆沿着机柜侧面或者上方桥架走线。采用冷板液冷的机柜,对风道的依赖有所减少,但光模块本身多数依然靠风冷或者局部冷却,走线管理的原则大体不变。
五、端面清洁、检测与运维方式的变化
端口和光纤数量多了,端面的数量也成倍增加。每一个MPO端面上有12或16个光纤端点,任何一点的污染都会引起该通道的损耗升高,对高速PAM4链路来说,误码率会随之抬高。插拔之前使用专用的一键式清洁工具处理,再用光纤显微镜检查,依据IEC 61300-3-35的端面判定标准确认合格之后再连接,已经是比较通行的流程。
链路检测也随之变化。依据TIA-568.3-D和ISO/IEC 14763-3,一级检测测量插入损耗和长度,二级检测加入OTDR,用来定位每一个连接点和熔接点的位置与损耗值。MPO链路的检测需要带有MPO接口的测试仪,一次测量一整个接口的全部通道,效率比逐芯测试高得多,测试的同时也能验证极性。预端接的施工方式在高密度布线里应用很多,厂内完成端接和检测,现场只需要敷设和连接,施工周期短,质量的一致性也比较好。标签和台账方面,二维码或者RFID标识逐渐普及,一个机柜里上千芯光纤,靠人工核对显然不现实。
六、快问快答
Q:一台配置64个800G端口的交换机,全部使用DR8模块,光纤布线大概需要多少芯?
A:DR8每个端口使用16芯,也就是8芯发射、8芯接收,64个端口合计1024芯,折合64个MPO-16接口。如果这台交换机作为汇聚层设备,向下连接多台叶脊交换机,每一条链路都要占用这样的芯数,一个由几十台交换机组成的集群,光纤总芯数很容易达到数万芯的量级。因此规划时,会先根据端口速率和拓扑估算出每个机柜、每一排机柜的芯数需求,再选择相应规格的主干光缆和配线架,让主干的容量与端口的容量相匹配,避免后续扩容时被迫重新布线。
Q:超小型连接器为什么受到关注,它与现有的MPO布线能兼容吗?
A:受关注的主要原因是面板空间。交换机面板的宽度有限,光模块的数量已经很多,配线架和转接面板的空间同样紧张,把连接器做小,可以在相同的空间里放下更多的芯数。兼容方面,CS、SN、MMC这类接口与MPO的物理形态并不相同,无法直接互插,需要通过转接光缆或者转接模块来对接。一些厂家推出了一端为MPO、另一端为超小型接口的转换跳线,用于在过渡期里衔接新旧设备。是否采用,要看光模块和交换机的接口定义,因为链路两端的连接形态由设备决定,布线的一侧只能配合。
Q:200 µm缩径光纤和常规的250 µm光纤,在熔接和连接器端接时能通用吗?
A:这个问题比较冷门。缩径的只是最外层的涂覆层,光纤的纤芯和包层尺寸没有改变,仍是125 µm的包层,所以连接器的插芯孔径和熔接机的对准方式,都是以包层为基准,两者可以通用。需要留意的是剥线的工具,涂覆层更薄,剥纤钳的刀口间隙需要与之匹配,否则容易损伤包层。带状光缆的间距也有所不同,普通带纤的光纤间距为250 µm,缩径带纤可以做到更紧凑,熔接时使用的夹具要对应带纤的规格。这一类光纤主要用在高芯数的主干光缆里,用于提升同等外径下的芯数,机柜内的短跳线仍以常规规格为主。
Q:MPO连接器有带导针和不带导针的区别,高密度布线里应该怎样搭配?
A:这个细节在装配时很容易被忽略。带导针的公头和不带导针的母头,需要一公一母配合使用,两个公头或者两个母头无法对准。光模块和交换机端口一般自带导针,跳线在接入模块的一端使用母头,主干光缆与转接模块之间、跳线与跳线之间的公母搭配,则由布线方案统一规定。方案通常会约定主干光缆两端使用同一类型,转接模块和跳线的类型据此确定,这样整个链路的公母关系不会混乱。预端接产品在出厂时,标签上会注明公母类型,安装之前逐一核对,可以避免现场发现不匹配之后再返工。
热门跟贴