我可以帮您推荐合适的AI工具,有什么需要帮忙的吗?
2026年9月18日,智谱正式推出全新大模型产品GLM-5.3-FlashX,官方公布其最高推理速度可达每秒200个token,主打企业开发者使用体验。该模型是此前曾以“Ox Alpha”之名面向全球开发者推出的GLM-5.3-Flash的迭代版本,智谱依托10万张国产芯片算力完成底层优化,目前该模型API已正式开放调用。
作为GLM-5系列的最新迭代推理产品,GLM-5.3-FlashX最突出的优势是最高每秒200token的推理速度,直接瞄准企业开发者普遍反馈的大模型推理慢、等待久的使用痛点。目前该模型的API已经正式上线,开发者调用时只需使用对应Model Key:GLM-5.3-FlashX即可完成接入。
GLM-5.3-FlashX的原型是此前面向全球开发者开放的GLM-5.3-Flash,这款产品曾以“Ox Alpha”为代号对外发布,凭借同尺寸模型梯队中领先的智能表现收获了海内外开发者的广泛认可,上线后模型调用量持续保持快速上涨态势。
为了匹配快速增长的市场调用需求,智谱依托现有10万张国产芯片组成的推理算力底座,持续在基础设施建设和推理优化技术方向投入资源,最终推出的GLM-5.3-FlashX首次实现了智能表现、定价优势、推理速度三个核心维度的兼顾。
对于对大模型响应速度有较高要求的生产场景来说,每秒200token的推理速度线,将大幅降低开发者的等待成本,直接提升相关生产环节的运行效率。智谱官方也明确将该型号的核心定位设定为优化企业开发者的使用体验。
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。