近日,字节跳动Seed团队联合清华大学智能产业研究院(AIR)正式推出基于大规模智能体强化学习(Agentic RL)的CUDA核生成系统CUDA Agent。实测数据显示,该系统在KernelBench测试集上96.8%的任务表现优于PyTorch官方的torch.compile工具,平均运行速度提升达2.11倍,为AI底层计算优化提供了全新技术路径。

随着大模型参数规模从十亿级向万亿级快速扩张,GPU算力的利用效率已经成为制约AI训练、推理成本下降的核心瓶颈。作为NVIDIA GPU架构下的并行计算核心,CUDA核的性能直接决定了AI任务的运行速度,但手写高性能CUDA核不仅要求开发者同时掌握硬件架构、底层编译、算法逻辑等多领域知识,还需要大量调试经验,单款模型的核优化往往需要投入数十人月的人力成本。
此前行业普遍使用的PyTorch官方自动编译工具torch.compile,虽然大幅降低了CUDA核的开发门槛,但受限于规则式优化的逻辑上限,其生成的核性能始终与人工手写的最优方案存在30%以上的差距,无法满足大模型大规模落地的成本需求。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录