Meta在AI基础设施网络领域又有新动作。这家科技巨头近日发布了一项名为MetaRoCE的全新RDMA传输协议,目标直指百万GPU规模的以太网集群。这一协议建立在Meta此前验证的RoCE技术基础之上,旨在解决大规模AI训练和推理场景中网络成为性能瓶颈的问题。

Meta一直是推动以太网成为AI基础设施首选网络架构的重要力量。此前,该公司已经展示了RoCE技术能够支撑大规模分布式AI训练。如今,MetaRoCE的推出,标志着Meta在这一方向上迈出了关键一步——从底层重新设计传输协议,以适应AI规模不断扩大的现实需求。

打开网易新闻 查看精彩图片

网络已成为AI算力的关键路径

打开网易新闻 查看精彩图片

Meta的实践数据显示,其AI集群已扩展到数十万GPU的规模,并跨越多个数据中心和区域。无论是训练下一代前沿模型,还是服务全球范围的推理需求,网络都处于关键路径之上。在训练过程中,all-reduce和all-to-all等集合通信操作需要同步数千个加速器,整个任务的节奏由最慢的传输决定。而在推理阶段,分布式模型分片之间的低延迟通信直接影响数亿用户的响应时间。

Meta指出,即使是微小的网络摩擦,也会直接浪费大量计算能力。这一现实使得网络性能优化变得至关重要。

从"网络中心"到"端点智能"的设计转变

传统RoCE协议依赖网络设备按顺序交付每个数据帧,通过PFC机制保证无损传输,并抑制了在多平面和大规模网络中能提升性能的数据包喷洒技术。MetaRoCE的核心设计理念则截然不同:网络结构看到的是数据包,而网卡看到的是意图。

传统架构将智能集中在网络结构中,依赖交换机来保证无损和维持顺序。MetaRoCE则将智能转移到端点,将网络分解为许多细粒度的逻辑路径,每条路径都拥有自己的实时遥测数据——包括每路径的往返时间(RTT)、ECN状态和利用率。这种可见性解锁了传统RDMA难以实现的能力。

打开网易新闻 查看精彩图片

乱序到达成为常态,数据直达内存

MetaRoCE在众多路径上喷洒数据包,因此数据包乱序到达是设计使然。该传输协议将乱序到达视为正常情况。每个数据包都携带自己的目的地信息,数据到达时直接写入最终内存位置,无需重排序缓冲区,也不会出现队头阻塞。

写入操作在每个数据包中都携带目的地信息。发送操作则携带与已发布接收缓冲区的匹配信息,即使前面的消息尚未到达,Send也能正确落地,无需通过往返通信来获知数据去向。集合通信库可以根据需要选择使用双边通信,而不必将所有操作简化为Write。

MetaRoCE为每个连接提供了一流的路径,并逐包进行喷洒。每条路径携带不同的UDP源端口作为ECMP熵,网卡可以随时更改该端口,将流量从不良路由上移开。在多平面网络中,平面选择完全由网卡决定,网络的利用效率取决于网卡的喷洒策略。由于每条路径保持自己的窗口和往返时间估算,传输层能够区分拥塞与故障,并进行显式再平衡,从而应对热点或故障路径。