DeepSeek联合清北发布DualPath框架:闲置网卡加速智能体推理性能

2026年2月27日,DeepSeek联合北京大学、清华大学在ArXiv平台发布全新智能体推理框架DualPath。该框架针对智能体长文本推理的I/O瓶颈,通过双路径设计激活闲置网卡带宽,在660B规模生产级模型测试中实现集群存储带宽全局池化,为大模型智能体落地提供算力优化新方向。

当大模型智能体处理万字级长文本或多轮复杂对话时,制约其推理速度的往往不是GPU算力,而是存储数据的读取效率——预填充引擎满负荷运转时,解码引擎的存储网卡却常常处于闲置状态,这种资源错配正成为生产级大模型落地的隐形障碍。

针对这一痛点,DeepSeek联合清北团队提出的DualPath框架彻底重构了传统的KV-Cache加载路径。

传统智能体推理采用Storage-to-Prefill单路径模式,所有KV-Cache数据都需通过预填充引擎的存储网卡加载,不仅容易造成带宽拥堵,还让解码引擎的存储网卡(SNIC)资源被浪费。而DualPath引入了Storage-to-Decode第二条路径:直接利用解码引擎闲置的SNIC带宽读取缓存数据,再通过高速计算网络(RDMA)将数据传输至预填充引擎,实现了集群存储带宽的全局池化与动态负载均衡。

在660B规模的生产级模型实验中,DualPath框架的优势得到了充分验证。

原本被闲置的SNIC带宽被全面激活,集群存储带宽的利用率得到显著提升,智能体在长文本推理场景下的运行效率大幅提高。更重要的是,这种优化无需额外购置昂贵的存储硬件,仅通过调整数据传输路径,就能让现有算力资源的价值最大化释放,为企业降低大模型落地成本提供了可行方案。

值得注意的是,此次发布的DualPath框架被视为DeepSeek V4大模型的核心技术剧透。此前,业界一直关注DeepSeek在GitHub上的更新动态,等待其V4版本的正式发布,而这篇论文则提前揭示了团队在智能体推理优化上的技术路线。

不同于单纯追求模型参数规模的思路,DeepSeek选择从算力资源的精细化利用入手,通过硬件与软件的协同优化破解智能体落地的核心瓶颈,这也为整个大模型行业提供了新的思路——当参数竞赛逐渐触顶,算力资源的高效利用或将成为下一个技术突破点。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。