2026年9月15日,NVIDIA cuDNN Graph API相关技术细节正式对外公开,内容覆盖内核融合、自动调优、计划复用、Flash Attention优化等核心特性,开发者可通过cuDNN Frontend实现对上述能力的落地应用,本次披露的技术信息为AI基础设施领域的研发人员提供了官方的工具使用参考。
本次披露的cuDNN Graph API核心能力覆盖四大核心模块:内核融合可通过算子合并降低显存访问损耗,自动调优可针对不同硬件配置匹配最优运行方案,计划复用可减少重复场景下的运算初始化耗时,Flash Attention优化则可针对性提升大模型相关场景的运算效率。
公开信息显示,开发者如需调用上述cuDNN Graph API的全部能力,需依托cuDNN Frontend完成相关配置与部署,当前相关技术内容已面向AI基础设施领域的研发人员开放。