2026年8月,字节跳动Seed团队联合清华大学智能产业研究院(AIR)正式发布智能体强化学习系统CUDA Agent,可训练大模型输出高性能GPU内核代码。此前基础大模型生成CUDA代码在KernelBench基准下通过率达74.0%,但仅27.2%运行速度超过torch.compile,该系统突破传统编译器性能瓶颈,标志AI在底层代码优化领域实现重要进展。

高性能CUDA内核的编写,一直是限制GPU算力释放的核心瓶颈:一名资深CUDA工程师往往需要数周甚至数月时间才能打磨出一套成熟的算子代码,而传统编译器的自动优化效果始终存在明显天花板。此前业界曾尝试用大模型自动生成CUDA代码,虽然语法正确率已经达到较高水平,但运行性能始终差强人意,无法落地到生产环境。
2026年8月18日公开的这套CUDA Agent系统,正是瞄准了这一困扰行业多年的痛点。在KernelBench通用CUDA内核评测基准下,字节跳动自研的基础大模型Seed1.6的任务通过率已经达到74.0%,但生成代码的运行速度超过torch.compile(PyTorch官方编译器)的比例仅为27.2%,平均几何速度甚至落后于传统编译器,完全达不到生产环境的使用要求。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录