Perplexity开源Lily推理引擎 苹果硅可高效运行35B级大模型

AI搜索公司Perplexity近期正式开源自研推理引擎Lily,该引擎基于Rust语言与苹果Metal框架开发,可在Apple Silicon芯片设备上高效运行通义千问Qwen3.6-35B-A3B大模型,解码速度较现有方案提升1.35倍,为消费级端侧部署百亿参数大模型提供了可落地的优化路径。

配图

随着端侧AI需求的爆发,如何在消费级硬件上运行更高参数的大模型,一直是行业探索的核心方向。此前30B以上参数的大模型普遍需要云端算力支持,即便是性能较强的苹果硅设备,运行此类大模型也普遍存在解码慢、内存占用过高的问题,用户体验难以达标。

此次Perplexity推出的Lily推理引擎,针对性解决了苹果生态下大模型推理的效率痛点。不同于多数现有推理工具依赖通用适配方案,Lily基于Rust语言与苹果Metal图形计算框架深度定制,前者自带的内存安全特性与高性能优势可大幅降低推理过程的额外开销,后者则能充分调用Apple Silicon芯片的GPU与神经网络引擎算力,避免硬件资源浪费。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。