
2026年7月30日,腾讯正式对外开源大模型统训框架AngelSpec。该框架通过多方案协同、工作负载异构适配能力,针对多轮对话、代码生成、数学推理等不同场景采取差异化优化策略,搭载自研DFly块扩散架构,可有效降低大模型自回归解码成本,大幅提升真实场景下的大模型推理吞吐量。

随着大模型参数规模持续攀高、下游应用请求量爆发式增长,自回归解码产生的算力成本已经占到大模型运营总成本的60%以上,成为制约大模型规模化落地的核心瓶颈。
此前行业推出的通用推理优化方案,大多基于标准化测试集设计,而真实业务场景中的请求特征差异极大:开放式多轮对话的输出随机性高、上下文变动频繁,代码生成、数学推理类任务的输出逻辑链长、结构约束性强,通用方案往往会出现“实验室跑分优异,落地效果大幅打折”的适配问题,始终未能解决真实场景的效率痛点。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录