近日,AI企业Z.ai正式发布新一代通用大模型GLM-5.3-Flash,该模型采用总参数320B、激活参数18B的混合专家(MoE)架构,原生支持多模态输入,上下文窗口长达100万token,同时开放MIT协议开源权重,API输入定价低至0.15美元/百万token,在推理效率、多模态理解能力上较前代实现大幅跃升,为各行业AI应用落地提供了高性价比新选择。
2026年以来,大模型产业的竞争核心已经从参数规模竞赛转向“性能-成本”平衡的落地能力比拼。此前行业普遍面临两难选择:闭源大模型性能达标但调用成本高企,开源模型普遍存在长上下文支持不足、多模态能力需要额外插件适配的问题,尤其是需要处理百页以上文档、跨模态内容分析的企业级场景,长期缺乏高性价比的模型选项。
随着AI应用从通用C端场景向垂直行业渗透,企业对大模型的需求也越来越具体:既要能处理长文档、多模态内容的高性能,也要足够低的部署和调用成本,还要有灵活的二次开发权限。
此前市面上同量级的MoE大模型普遍激活参数在30B以上,单卡推理成本居高不下,而支持百万token上下文的模型多数为闭源产品,商用授权费用高昂,大量中小团队和垂直行业客户的需求难以被满足。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录