2026年9月24日,布拉格AI初创公司BottleCap AI正式发布了一款名为ThinkingCap-Qwen3.8-27B的推理Token精简微调模型,基于阿里Qwen3.8-27B打造。该模型的一大核心卖点在于:官方宣称在12项基准测试上平均减少37.2%的思考Token,同时仅带来0.86个百分点的准确率下降。这一数据组合使它在兼顾性能与推理效率之间,尝试给出一个新的平衡点。
ThinkingCap-Qwen3.8-27B的基座是阿里开源的Qwen3.8-27B,该模型拥有27B参数,原生支持视觉语言任务,采用64层Transformer架构,上下文窗口达262K。BottleCap AI针对其推理过程中产生的大量中间思考Token进行微调压缩,目标是降低部署和推理开销,同时保持模型原有性能水平。
该模型主打“drop-in”式的直接替换体验,在部署层面提供了多种格式适配。面向NVIDIA GPU的NVFP4和FP8版本,可经vLLM高效部署,支持Hopper及Blackwell架构;另有MLX 4-bit版适配Apple Silicon Mac,GGUF版则面向llama.cpp用户。其中MLX版约21 GiB,可在32GB内存的Mac上运行,并保留了视觉能力与MTP推测解码功能。
减少37.2%思考Token,换取0.86个百分点的平均准确率回落,这一比例在同类工作中具备一定的参考意义。横向对比来看,原版Qwen3.8-27B自带“medium”推理档位虽然可节省52.1%的思考Token,但准确率代价也相应提升至9.16分。ThinkingCap以不到1分的代价获得相近的收益,其优化效率值得关注。
从官方数据看,覆盖12个基准的测试中,某些任务的实际表现甚至不降反升,例如RAG评估提高了2.25分,这也说明不同任务对思考Token的敏感度并不一致,精简并非一律以牺牲准确率为代价。
BottleCap AI是一家2025年成立于布拉格的AI初创公司,三位核心创始人分别为:word2vec作者、现任首席科学官的Tomáš Mikolov;知名VR音游Beat Saber联合创始人、现任CEO的Jaroslav Beck;以及David Herel。公司已获得由20VC领投的750万美元种子轮融资。
该公司定位明确,聚焦“效率优先”路线,不追求更大的模型规模,而是致力于压缩既有开源模型、削减推理开销。值得注意的是,公司自有基础模型CAP1已支撑其iOS新闻应用Pulse,展现了从研究到应用落地之间的完整闭环能力。
ThinkingCap-Qwen3.8-27B采用PolyForm Small Business许可协议。个人用户以及百人以下的小型企业可以免费使用该模型,而大型企业则需获得商业授权。开发者在规划商用部署时,需要结合自身企业规模审视许可条款,这一点应特别留意。
模型发布后,社区已快速衍生出GGUF量化版本(Q4_K_M/Q6_K/f16)以及Abliterated版本。第三方实测显示,Q6_K量化版在GPQA基准上的得分为87.1%,与原版89.2%的成绩较为接近,进一步印证了该模型在压缩之后仍具备较强的推理能力。
在当前大模型领域普遍追逐参数规模与多模态能力的背景下,BottleCap AI选择了一条更务实的路径:在不牺牲太多准确率的前提下,大幅压缩推理阶段的Token消耗,这一点对于推理成本高度敏感的生产环境颇为重要。
在推理链优化与成本预估环节,开发者可借助 AICosts.ai 构建细化的成本模型;结合 QwenWork、QwenPaw 等工具进一步理解Qwen系模型的能力边界;通过 Qwen Cloud 可实现快速部署;而 Thinking Line 这类辅助工具,则可以帮助分析思维链长度与输出质量之间的关系。
需要指出的是,官方公布的0.86个百分点准确率降幅是基于其选定的12项基准的平均值,个别特定任务上的波动可能更为明显,实际业务场景中的效果仍需更多独立验证。37.2%的思考Token削减与接近无损的准确率表现,究竟是普遍适用的优化范式,还是特定基座模型下的个案结果,还有待更多同类工作的后续印证。作者认为,ThinkingCap-Qwen3.8-27B不失为一次有参考价值的效率优化实践,为开源模型的高性价比落地提供了新思路。