
近日,全新大语言模型推理加速技术DFlash推测解码正式适配英伟达新一代Blackwell架构GPU。该技术依托块扩散草稿、KV注入两大核心路径,可并行生成完整Token块,在英伟达Blackwell平台上实现最高15倍的大语言模型推理吞吐量提升,大幅降低大模型落地算力成本,为AI Agent、多模态大模型等场景的规模化部署提供新支撑。

大语言模型落地进入深水区,推理效率已经成为制约行业规模化的核心瓶颈。据行业调研数据显示,2026年全球AI厂商的推理算力支出占比已经超过总算力成本的72%,较2024年提升了28个百分点。随着AI Agent、多模态生成等场景的需求爆发,行业对大模型推理吞吐量的需求较两年前增长了11倍,传统的逐Token推理架构已经很难匹配当前的业务需求。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录