近日,边缘原生混合专家模型(MoE)服务引擎FreeToken正式对外公布,该项目采用Apache-2.0开源协议,可在配备8GB显存的消费级笔记本上运行35B参数大模型,单块工作站级GPU即可支持753B参数的GLM-5.2大模型推理,大幅降低了超大规模大模型的部署门槛,为边缘侧大模型落地提供了全新的技术路径。
随着大模型参数规模不断向千亿、万亿级攀升,算力门槛正在成为普通开发者接触超大规模大模型的核心障碍:此前700B参数级别的大模型推理往往需要十几块甚至几十块专业GPU组成的集群才能支撑,仅硬件成本就高达数十万元,中小团队几乎没有独立调试的可能性。
一方面,工业制造、智能硬件、政务金融等多个场景对本地化大模型部署的需求持续上涨,用户既需要大模型的高阶推理能力,又要求数据不出域、响应速度不受网络限制,边缘侧大模型的市场缺口正在不断扩大。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录