登录体验完整功能(收藏、点赞、评论等) — 已累计有 13576 人加入

字节跳动联合清华AIR发布CUDA Agent CUDA核性能提升2.11倍

详情页推荐

近日,字节跳动Seed团队联合清华大学智能产业研究院(AIR)正式推出基于大规模智能体强化学习(Agentic RL)的CUDA核生成系统CUDA Agent。实测数据显示,该系统在KernelBench测试集上96.8%的任务表现优于PyTorch官方的torch.compile工具,平均运行速度提升达2.11倍,为AI底层计算优化提供了全新技术路径。

配图

随着大模型参数规模从十亿级向万亿级快速扩张,GPU算力的利用效率已经成为制约AI训练、推理成本下降的核心瓶颈。作为NVIDIA GPU架构下的并行计算核心,CUDA核的性能直接决定了AI任务的运行速度,但手写高性能CUDA核不仅要求开发者同时掌握硬件架构、底层编译、算法逻辑等多领域知识,还需要大量调试经验,单款模型的核优化往往需要投入数十人月的人力成本。

此前行业普遍使用的PyTorch官方自动编译工具torch.compile,虽然大幅降低了CUDA核的开发门槛,但受限于规则式优化的逻辑上限,其生成的核性能始终与人工手写的最优方案存在30%以上的差距,无法满足大模型大规模落地的成本需求。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。