
国内大模型厂商Moonshot AI(月之暗面)近日正式开源专家并行计算库MoonEP,该库采用MIT开源协议,可实现MoE(混合专家模型)训练过程中各并行节点负载完全均衡,每个EP rank处理token数稳定维持在S×K标准值,大幅降低了超大规模MoE模型的训练门槛与算力损耗。
随着GPT-4、Claude 3等旗舰大模型相继采用MoE架构,混合专家模型已经成为千亿、万亿参数大模型的主流技术路线,但训练端的负载失衡问题,始终是掣肘MoE模型落地的核心瓶颈。
据行业测算,传统专家并行训练方案下,由于token路由分配的随机性,不同计算节点的负载差普遍在15%-30%之间,算力资源被大量浪费。尤其当训练集群规模超过512卡时,负载不均带来的调度损耗会进一步放大,甚至可能导致训练中断,仅国内科技企业每年因此产生的额外算力成本就超过10亿元。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录