上海交通大学联合辉羲智能、微软亚洲研究院的研究团队,近期推出基于ROM+SRAM异构存储架构的端侧大语言模型方案,将端侧LLM推理速度推至20000 tokens/s,成功突破传统算力的“内存墙”瓶颈,为AI端侧部署开辟全新路径,或将动摇当前GPU主导的大模型算力市场格局。
不久前,硅谷初创公司Taalas将大模型参数“物理焊死”进专用芯片的消息,曾在全球半导体圈引发热议——这被视为端侧AI部署的一次大胆尝试。但来自国内的研究团队,已经用更具颠覆性的架构设计,把端侧大语言模型(LLM)的推理速度推到了前所未有的高度。
传统大模型推理的核心瓶颈,是被行业称为“内存墙”的存储带宽限制:大模型的数十亿参数需要频繁在存储单元与计算单元之间搬运,而普通DRAM内存的带宽不足,直接拖慢了推理速度。当前主流的云端大模型依赖英伟达GPU的高带宽内存(HBM)缓解这一问题,但HBM的高昂成本,让大模型的端侧部署始终难以规模化。
上海交通大学联合辉羲智能、微软亚洲研究院的团队跳出了“靠高带宽内存提速”的固有思路,采用ROM+SRAM异构存储架构:将大模型训练完成后固定不变的数十亿参数,存储在非易失性的ROM芯片中,而动态计算所需的临时数据,则放在高速SRAM中,彻底避免了参数反复搬运的带宽消耗。最终实现的端侧LLM推理速度达20000 tokens/s,按1token≈0.75汉字的通用换算,每秒可处理近1.5万字的AI任务,足以支撑实时长篇对话、专业文档生成等复杂场景。
当前大模型的主流部署方式是云端算力集群,虽然能支撑千亿级参数的大模型运行,但存在三大核心痛点:一是延迟高,无法满足自动驾驶、实时语音助手等对响应速度要求极高的场景;二是成本高,单台英伟达H100 GPU的年运维成本可达数十万元;三是隐私风险,用户的敏感数据需上传云端,易引发数据泄露问题。
端侧部署被视为解决这些痛点的核心路径,但此前受限于内存带宽,端侧LLM只能运行参数规模较小的模型,推理速度普遍在几千tokens/s以下,无法支撑复杂AI任务。本次20000 tokens/s的速度突破,意味着端侧设备可以脱离云端算力,独立承担高端AI任务,真正成为“本地超级大脑”,为车载AI、智能家居、工业边缘计算等场景带来全新的应用可能。
当前全球大模型算力市场被GPU巨头英伟达主导,其A100、H100系列芯片占据了90%以上的云端大模型算力份额,形成了明显的技术壁垒。但随着端侧AI的爆发,专用化、低功耗的端侧AI芯片正在成为新的赛道。
本次ROM+SRAM异构架构的创新,本质上是用“存储架构优化”替代“高算力硬件堆叠”,为端侧AI芯片提供了全新的设计思路——未来无需依赖GPU的高带宽内存,仅靠ROM+SRAM的组合,就能实现高性能的大模型推理。这不仅会大幅降低端侧AI设备的成本,还可能打破GPU对大模型算力的垄断,催生一批专注于端侧AI芯片的创业公司,重构全球AI算力的市场格局。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。