
近日英伟达公布Transformer Engine最新技术优化方案,通过融合内核、FP8低精度计算、BF16混合精度调度等技术组合,在Hopper架构GPU上的实测显示,千亿参数Transformer架构大模型的训练速度最高可提升38%,同时显存占用率下降22%,为大语言模型、多模态模型的训练降本提供了可行的技术路径。

当前大模型行业的竞赛已经从“参数竞赛”转向“效率竞赛”,千亿参数级大模型单轮训练成本动辄数百万元,训练迭代速度直接决定了厂商的产品落地节奏,从软件栈层面挖掘现有硬件的算力潜力,已经成为全行业的共同诉求。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录