登录体验完整功能(收藏、点赞、评论等) — 已累计有 13568 人加入

DFlash推测解码适配英伟达Blackwell 吞吐量最高提15倍

详情页推荐

近日,全新大语言模型推理加速技术DFlash推测解码正式适配英伟达新一代Blackwell架构GPU。该技术依托块扩散草稿、KV注入两大核心路径,可并行生成完整Token块,在英伟达Blackwell平台上实现最高15倍的大语言模型推理吞吐量提升,大幅降低大模型落地算力成本,为AI Agent、多模态大模型等场景的规模化部署提供新支撑。

配图

大语言模型落地进入深水区,推理效率已经成为制约行业规模化的核心瓶颈。据行业调研数据显示,2026年全球AI厂商的推理算力支出占比已经超过总算力成本的72%,较2024年提升了28个百分点。随着AI Agent、多模态生成等场景的需求爆发,行业对大模型推理吞吐量的需求较两年前增长了11倍,传统的逐Token推理架构已经很难匹配当前的业务需求。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。