
近日,英伟达正式推出开源混合专家(MoE)大模型Nemotron 3.5 Lightning与配套路由组件NeMo Switchyard。该模型总参数规模达30B,运行时仅激活3B参数,在保障推理效果接近同规模稠密模型的前提下,大幅降低算力消耗,为企业级AI应用开发、智能体落地提供了更高性价比的开源基座选项,引发AI开发社区广泛关注。

就在全球AI开发者还在为大模型“性能与成本不可兼得”的痛点头疼时,英伟达这次的新品直接踩中了行业最核心的需求:既开放权重支持二次开发,又把推理成本压到了中小团队也能负担的水平。
过去两年,MoE架构凭借“多专家并行、按需激活”的特性,已经成为大模型性能突破的核心方向之一,但市面上主流的开源MoE模型普遍存在激活参数过高、路由效率不足的问题:不少30B以上规模的MoE模型激活参数普遍在8B以上,单卡推理成本仍然偏高,而闭源MoE模型的API调用成本更是让大量垂直行业企业望而却步。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录