Meta正在为AI基础设施的网络层寻找新的答案。这家公司日前通过开放计算项目(OCP)发布了MetaRoCE——一个专为AI工作负载设计的全新RDMA传输协议,同时公开了协议规范、参考软件实现和合规性测试套件,供行业采用和二次开发。
为什么需要新协议
训练和部署前沿AI模型,依赖的是GPU之间快速、可靠的数据传输网络。Meta已经将集群扩展到数十万GPU的规模,横跨多个数据中心和区域。无论是训练下一代前沿模型,还是服务全球规模的推理任务,网络都处于关键路径上。
训练过程中,all-reduce、all-to-all等集合通信操作需要同步数千个加速器,最慢的一次传输决定了整个任务的节奏。推理场景中,分布式模型分片之间的低延迟通信,直接影响数亿用户的响应时间。哪怕只是少量的网络摩擦,也会造成可观的计算能力闲置。
标准的RoCE协议依赖网络按序交付每个数据帧,借助PFC(优先级流控)机制,并抑制了在多平面和大规模网络中能带来性能提升的报文喷洒。MetaRoCE的目标,是在加速器数量和节点间距离不断增长的情况下,依然保持高吞吐、低尾延迟和运维简单性。
核心思路:把智能从网络搬到网卡
MetaRoCE的核心洞察很直接:网络结构看到的是报文,而网卡看到的是意图。传统架构把智能集中在网络结构中,依赖交换机来保证无损和有序。MetaRoCE则把智能下沉到端点,将网络分解为大量细粒度的逻辑路径,每条路径都有自己的实时遥测数据——包括路径RTT、ECN状态和利用率。这种可见性,解锁了传统RDMA难以实现的能力。
原生支持乱序到达
MetaRoCE将报文喷洒到多条路径上,因此报文按设计就会乱序到达。协议把乱序到达视为正常情况。每个报文都携带自己的目的地信息,数据到达后直接写入最终内存位置,无需重排序缓冲区,也不会产生队头阻塞。
写操作在每个报文中携带目的地信息。发送操作则携带与已发布的接收缓冲区匹配的信息,即使前面的消息尚未到达,Send也能正确落地,无需通过一次往返来获知数据去向。集合通信库可以在适合的场景使用双端消息传递。
热门跟贴