Meta AI近期发布自研全新RDMA传输协议MetaRoCE,该协议采用从零搭建的原生架构,专门适配超大规模AI训练场景下的以太网集群需求,在1%网络丢包环境下仍可保持86%的传输吞吐量,大幅缓解AI集群的网络传输瓶颈,为下一代万卡级AI训练集群的部署提供了新的底层网络技术路径。

随着大模型参数规模突破万亿级,万卡甚至十万卡级的分布式训练集群已经成为头部AI厂商的标配,但算力扩容的背后,跨节点的参数传输效率已经成为制约整体算力释放的核心瓶颈。
RDMA(远程直接内存访问)是当前AI集群普遍采用的底层传输技术,它可以绕过操作系统内核直接实现不同服务器内存间的数据传输,相比传统TCP协议拥有更低的延迟和更高的带宽利用率。但长期以来,适配以太网的RoCE标准协议对网络丢包容忍度极低,仅0.1%的丢包就会导致吞吐量下降50%以上,1%丢包场景下几乎无法正常工作。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录