登录体验完整功能(收藏、点赞、评论等) — 已累计有 13327 人加入

Swiftlet运行时技术突破 80B量级Qwen模型可在苹果设备低耗运行

详情页推荐

2026年8月发布的Swiftlet Swift+Metal运行时针对通义千问Qwen系列MoE大模型优化,通过专家权重SSD存储、按需流式加载的方案,可在M5 Mac上实现80B参数Qwen3-Next模型峰值内存仅4.3GB,35B参数Qwen3.6模型峰值内存低至2.6GB,后者还可在iPhone 17原生运行,大幅降低大参数模型端侧部署门槛。

配图

不少用户对端侧大模型的认知还停留在7B、14B参数的入门级模型,想要体验能力更强的35B以上参数模型,往往需要调用云端接口,既受网络波动限制,也存在敏感数据上传的隐私风险。过去两年,端侧AI的硬件升级速度很快,但内存瓶颈始终是限制大参数模型落地的核心障碍,动辄几十GB的参数加载需求,让消费级设备根本无力承载。

Swiftlet运行时的核心巧思,恰好命中了MoE混合专家模型的调度特性:这类模型并不会同时调用所有专家参数进行计算,绝大多数时候只有少量核心单元处于工作状态。

基于Swift+Metal框架开发的Swiftlet索性改变了传统大模型运行全量参数加载到内存的逻辑,只保留小型稠密核心常驻内存,占参数大头的路由专家权重全部存储在SSD中,只有调度到对应模块时才会按需流式加载,从根源上压缩了内存占用,同时也没有明显损失模型的推理精度。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。