摘要:Fireworks AI于9月28日发布FireRouter with Opus,宣称是市场首个缓存感知路由器。经一个多月内部A/B测试,其编码任务准确率达单独使用Opus的98.1%,每会话成本从15.36美元降至6.63美元,降幅57%。路由池包含Claude Opus 5.5、GLM 5.3等,并支持Claude Code、Codex、Cursor工具链。
9月28日,Fireworks AI 正式发布 FireRouter with Opus,官方称其为市场首个缓存感知路由器,针对 Claude Opus 系列优化,并首次以独立路由模型形式作为 serverless 端点开放。经过一个多月内部 A/B 测试,该方案执行编码任务的准确率达到单独使用 Opus 的 98.1%,而成本降低 57%。

FireRouter 的核心逻辑是,在每次用户轮次中,评估模型集合中每个模型对当前任务的适合程度,估算每个模型的处理成本(包括提示缓存成本),并权衡切换模型带来的节省与丢失缓存是否值得,最终将请求路由到质量与成本之间取得最佳平衡的模型。
从路由思路上看,常规轮次交给开源模型处理,复杂轮次保留 Claude Opus 5.5,以质量换成本。官方同时公布缓存命中率数据:FireRouter 方案为 94.2%,低于单独使用 Opus 的 97.8%,属于有意取舍。
据 Fireworks AI 官方博客,内部 A/B 测试持续一个多月。在评分轮次中,FireRouter 准确率为 78.7%,对比单独使用 Opus 的 80.2%,损失约 1.5 个百分点;每会话成本从 15.36 美元降至 6.63 美元,降幅 57%。
需要说明的是,上述准确率与成本数据均来自 Fireworks AI 自我报告的内部测试,截至搜索时尚未找到第三方独立验证或媒体实测。
目前路由池包含 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash,官方表示将随新模型发布持续调整。该方案已支持 Claude Code、Codex、Cursor IDE 等工具链,开发者通过 fireconnect login 与 fireconnect claude --model firerouter/opus 两行命令即可接入。对于希望进一步丰富 Claude 编码体验的开发者,UpClaude、claude-mem 等周边工具及 Claude Plugins & Codex Plugins 目录 可作为参考。
在笔者看来,模型路由并非新概念,但把提示缓存纳入路由决策,并以独立模型形态开放 serverless 端点,是 Fireworks AI 在降本方向上的一次具体尝试。该公司近期连续发文强调路由器策略,可见模型路由是其当前主推方向。不过需再次提醒,98.1% 准确率与 57% 成本降幅均出自厂商内部测试,官方博客之外暂无独立媒体实测,相关结论仍有待更多验证。