近日面向AI计算基础设施领域的开发工具TileLang正式发布,该工具可支撑开发者快速设计高性能GPU内核,原生支持张量核心GEMM、融合Softmax(Fused Softmax)、FlashAttention等主流AI算子开发,搭配内置的自动调优功能,可将大模型推理、训练等AI工作负载的运行效率最高提升40%,目前已配套上线完整开发教程供开发者使用。
随着大模型参数规模持续向万亿级突破,AI训练与推理环节的算力成本已经占到企业AI落地总成本的60%以上,而底层GPU内核的优化程度,直接决定了同等硬件条件下的AI工作负载运行效率。
过往高性能GPU内核大多依赖资深工程师手写CUDA代码实现,要求开发者同时掌握GPU硬件架构、算子逻辑、汇编级调优等多重技能,相关人才缺口极大。尤其是FlashAttention、张量核心GEMM这类需要做多层算子融合的复杂算子,开发周期往往长达数周,且很难适配不同型号的GPU硬件,大量中小团队根本没有能力完成相关优化。
TileLang的核心定位就是降低高性能GPU内核的开发门槛,其从设计之初就针对AI场景的主流算子做了针对性优化。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录