AI开发工具厂商Cursor近日宣布开源名为Mixture-of-Kittens(简称MoK)的确定性混合专家(MoE)训练大内核,该项目采用Apache-2.0开源协议,专为英伟达GB300 NVL72机架设计,在MXFP8精度场景下训练效率较现有方案提升2.37倍,解决了此前大规模MoE模型训练的一致性波动与算力浪费问题,为大模型厂商训练超大规模稀疏模型提供了高性价比的底层工具选择。

从2025年下半年开始,英伟达GB300芯片就陆续交付给全球头部大模型厂商,不少厂商斥资数十亿采购的整机柜集群,实际运行MoE训练任务时的算力利用率却始终低于40%,这一痛点直到Cursor的新开源项目发布才迎来了突破性的解决方案。
混合专家(MoE)架构已经成为当前超大规模大模型的主流技术路线,OpenAI GPT-4o、Anthropic Claude 3.5 Opus等头部产品均采用了该架构,通过激活部分参数的方式降低推理和训练成本。但长期以来,MoE训练的底层内核始终存在两大核心问题:一是路由调度的随机性导致训练结果不可复现,同一份数据、同一套参数多次训练得到的模型效果存在差异,极大提升了调参难度;二是主流内核未能适配最新的硬件架构,尤其是GB300 NVL72机架高达3.6TB/s的NVLink互联带宽,传统内核根本无法跑满,造成了大量的算力浪费。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录