通信世界网消息(CWW)运营商智算广域网:从应用场景到技术栈的思考人工智能的热潮正以前所未有的速度重塑全球产业格局。随着大模型参数规模迈向万亿级,AI对网络基础设施提出了迅猛增长的需求。单一资源池已难以独立承载大模型的训练与推理,智算网络正从数据中心内部向广域范围延伸,成为运营商战略布局的核心赛道。
与此同时,AI商业变现的迫切需求使得推理资源池取代训练资源池,成为现阶段智算中心建设重点。为了提供差异化服务,推理资源池部署向云边多层协同发展,网络技术也从局域独立组网向广域协同组网演进。在这一过程中,运营商凭借其广域网资源优势,成为连接分散算力、实现资源协同的关键角色。
1、运营商网络技术演进与智算广域定位
回顾运营商广域网的发展历程,技术栈经历了从IP到MPLS,再到SRv6的逐步演进。IP时代以连通性为目标,MPLS时代引入流量工程能力,而SRv6则通过源路由机制实现了更灵活、更智能的网络编程能力。这一演进不仅是转发效率的提升,更是网络能力从面向连接向面向业务转型的体现。
当前,网络技术的焦点已明确转向智算网络,运营商普遍将智算广域网作为研究重点。
2、智算内网络与广域扩展的技术鸿沟
当前智算中心内部网络主要采用RDMA技术承载。RDMA协议在设计之初高度依赖局域网内高可靠、无损的IB网络,因此在协议层面弱化了丢包容错与长距适应能力。
当智算网络从单一智算中心内外延到广域网时,技术鸿沟逐渐显现:
广域时延明显加大。智算中心内部网络时延为微秒级(通常小于10μs),而智算中心间长距传输时延达毫秒级(1000公里单向5ms时延)。长距导致RDMA ACK报文时延增加,端侧吞吐显著下降。
广域网络质量劣化。智算内网络距离有限,可认为基本零丢包,但广域网长距会导致网络劣化,普遍存在丢包现象(通常为0.001%~0.1%)。RDMA采用的GBN重传机制在广域场景下重传开销加大,传输效率急剧恶化。
广域拥塞控制路响应滞后。ECN在长距场景下反馈路径变长,拥塞通知无法及时到达源端网卡,源端降速反馈变慢,可能导致中间设备缓存溢出,进而引发丢包和性能下降。
上述挑战意味着智算广域网不能简单复制智算中心内网络技术,需针对广域网进行专门设计,在拥塞控制、细粒度负载均衡、多路径聚合等方面进行优化。
3、运营商智算广域网核心应用场景
根据业务场景的需求特征,智算广域网可归纳为四大核心应用场景:海量样本数据入算、存算分离拉远、分布式推理和智算协同训练,业内运营商和设备厂商均认可对这四类场景的定义。
3.1 海量样本数据入算场景
该场景指运营商向用户提供智算训练服务时,海量样本数据(如气象数据、基因测序数据、视频监控数据等)位于用户园区内的存储服务器上,而用于训练的GPU资源池在运营商侧,需要周期性将海量数据跨广域传送到运营商智算中心,然后才能启动训练任务。
此类传输的数据量极大(TB级甚至PB级),但实时性要求相对较低。流量特征取决于端侧应用开发采用的网络协议底座,常用HTTP/HTTPS/FTP等,采用标准网卡收发流量。因此,该场景对广域网的需求并不苛刻,网络提供闲时带宽服务和多路径服务即可满足基本要求。运营商可通过流量调度策略,将此类海量数据安排在网络低峰时段如夜间传输,实现网络资源利用率最大化。
3.2 存算分离拉远场景
该场景指训练样本数据存放于用户园区,而训练在运营商智算中心内完成,用户有特殊的数据不落盘要求——即原始数据、中间态数据和Checkpoint数据均不允许存储在运营商智算中心的存储设备上,仅允许暂存于GPU内存或CPU内存中。此场景主要针对对数据安全有较高要求的训练用户,如政务、金融、医疗等行业,用户不希望行业数据在运营商侧留痕。
训练过程中的数据流转涉及多种存储资源池:海量存储资源池存放原始数据及预处理中间态数据,存算分离下这些数据位于用户园区,无需跨广域传输。高性能存储资源池存放训练样本数据和Checkpoint数据,存算同机房时通过100G/200G存储网连接,存算分离时则需跨广域传输,此时要求广域网针对此类流量进行带宽保障及拥塞控制,避免影响整体训练效率。
3.3 分布式推理场景
该场景包含多个子场景,最具代表性的是推理模型分层拉远部署子场景和PD分离拉远部署子场景。
推理模型分层拉远部署指将模型前几层和最后几层部署在用户园区侧,模型中间层部署于运营商推理池,资源池之间传送的隐变量为高维向量,无可读性语义。此场景同样面向对数据安全有较高要求的推理用户,通过用户侧与运营商边缘推理池的GPU协同,既完成推理任务,又保证推理请求和推理结果不在运营商侧留痕。此时用户推理框架需感知GPU的跨域分布,跨广域网流量大小与模型参数量、精度、并发数、上下文长度等因素强相关,广域网需针对此类流量进行特定保障,以达成推理关键性能指标。
PD分离拉远部署指推理的Prefill节点和Decode节点部署于不同层级的推理池,在推理响应指标与资源池化能力间寻求平衡。资源池之间主要网络流量为KVCache同步流量,广域网需针对此类流量进行特定保障,以达成推理关键性能指标。
3.4 智算协同训练场景
该场景主要应对两类问题:
智算资源碎片化:单个智算中心剩余算力不足以满足新用户的完整训练任务,需将多个智算中心的剩余算力进行逻辑整合,形成统一的算力资源池。
超大模型训练的电力/空间限制。以1万张H100 GPU的智算中心为例,总电力需求高达14.4MW,相当于万人小型社区的规模,远超单一智算中心的供电和散热能力。因此必须通过多个异址智算中心协同完成训练任务。
智算协同训练对智算互联设备的接口密度和性能要求极高,难以靠现有网络升级扩容来支撑,一般需要新建智算互联网。同时考虑到长距RTT对训练效率的影响和极高带宽带来的高昂传输成本,业界普遍将100~300km作为智算协同训练的传输距离上限。
需要强调的是,智算协同训练效率的提升不能仅依赖网络设备,还需从整体方案角度进行系统性优化。模型切分方式直接影响跨智算中心的流量特征,推荐优先采用PP并行切分,但PP流量的划分均衡性极为关键,不均衡划分将使跨中心流量剧增。另外,通信库(如NCCL、HCCL)需感知智算网络拓扑变化,区分服务器内、同Leaf服务器间、同智算中心内、不同智算中心间的通信等级,针对跨中心QP连接做端侧优化配置,并通过算法调整使计算与通信尽量重叠,最大程度减小长距对整体训练性能的影响。
4、新华三智算广域网技术栈
智算内网络以无损为核心目标以保证RDMA承载效率,但广域网受长距传输质量制约,目标宜合理放宽至低损。建设层面,智算中心内网络可全新构建,智算中心间广域网则需充分考虑对现网的复用,最大限度降低改造投入。跨广域端到端涉及发送GPU、源侧网卡、源侧智算内网、源侧智算互联设备、广域网、目的侧智算互联设备、目的侧智算内网、目的侧网卡及接收GPU等多环节,应在全路径上保持开放解耦,优先采用成熟标准,避免引入厂商私有协议,形成技术壁垒。
用于运营商智算广域网场景的智算互联设备相较传统数据中心出口设备,适配新场景,支持新功能,且需同时承载东西向和南北向报文流转,因此大容量路由器成为运营商智算互联设备的优选。新华三以CR19000-X为代表的新一代核心路由器,可匹配运营商智算互联设备需求,围绕智算广域网场景进行了多项关键技术创新。
综合上述四大类应用场景,智算间广域流量主要以RDMA封装为主,智算互联设备需要针对RDMA流量特征进行优化处理。
4.1 长距快速拥塞控制技术(快速CNP)
拥塞控制的核心目标是实现源端Host与目的端Host间发送速率与接收速率的匹配,在吞吐量与拥塞丢包之间取得平衡。智算广域网中,拥塞控制面临三大挑战:长距带来的大缓存需求、拥塞判断的滞后性、以及拥塞通告的硬件快速性要求。
缓存大小计算需综合考虑传输开销(接口速率×RTT)和处理开销(互联设备能力),与传输距离强相关。以400G接口、100km距离为例,需预留约50MB缓存。所有发送的数据包在未被确认前,均在设备缓冲区中积压,通过反馈和确认机制逐步释放。
本技术的关键创新在于:基于广域传输距离设置缓存阈值,根据阈值判断拥塞状态,一旦检测到拥塞征兆,互联设备硬件主动生成CNP报文并返回源Host,促使其快速降速,避免拥塞恶化导致丢包。这一机制将拥塞反馈从端到端的被动响应,转为网络设备的主动快速通告。
本技术优势在于,在广域有损网络环境下仍可支持RDMA高效传输(低损保障);基于RDMA QP进行拥塞控制,粒度比租户级更精细,更符合RDMA流量的微观特征(精准流控);提前判断拥塞并尽快通告源端(快速拥塞通告);以及为适配广域长距RTT预留足够缓存空间(大容量缓存)。
4.2 RDMA大象流深层QP识别技术
RDMA报文在广域网传输与智算中心内一样存在大象流现象,传统基于流Hash的负载分担方式,仅参考五元组计算HASH值,可能会将多条大象流分配到同一条物理链路,造成链路拥塞、负载不均衡。
QP是RDMA通信的基本单元,每个QP唯一标识一条独立的工作流。在五元组基础上增加QP 作为Hash因子进行负载分担,可确保同一大象流的所有报文走同一条路径并避免乱序问题,同时天然将不同大象流拆分到不同链路,实现精细化的流量调度。
本技术优势在于,虽然主流网卡基本支持基于内层负载修改UDP源端口号来区分子流,但基于QP进行HASH的方式对网卡功能要求更简单,可适配更广泛的硬件生态。
4.3 SRv6多路径大带宽聚合服务
智算业务对网络带宽的消耗极大,RDMA网卡接口带宽从100G、200G、400G到800G快速迭代,广域网单一物理链路难以匹配性能需求。SRv6多路径技术可通过以下机制提供大带宽聚合服务:
首先,为智算业务单独划分满足SLA要求的无损切片,隔离传统业务的干扰,确保智算流量的服务质量。其次,在智算业务切片内部署一定数量的Segment List,PE针对每条组合数据流在多个List间实现多链路UCMP负载分担。最后,根据智算业务切片的流量特征和数据业务流情况,动态调整List中的流和List带宽权重,实现高吞吐和精细化流量调度。
本技术优势在于,将底层多条物理链路在逻辑上聚合成大带宽通道,同时通过UCMP实现非等比分担,适应不同链路的带宽差异,极大提升了广域网络的带宽利用率和灵活性。
5、总结与展望
运营商拥有覆盖广泛、分层分级的广域网络,从末端微秒级接入到骨干T级带宽,具备天然的网络纵深优势。面对智算时代互联网厂商的竞争,运营商正依托这一优势,推动业务模式从通用算力的“网随算动”向通算与智算并重的“算网共生”演进。当前,智算广域网正处于技术路线多样化窗口期,作为运营商主流网络供应商,新华三始终与运营商保持密切技术沟通,提出新华三面向智算广域场景的技术栈及解决方案,助力运营商在智算时代抢占先机。
热门跟贴