摘要:阿里于2026年9月23日在云栖大会发布Qwen-Audio-3.1系列,其中Qwen-Audio-3.1-Realtime为全双工实时语音模型,能同时听说、随时插话打断,具备262K上下文、工具调用与联网搜索能力,并通过GRPO训练学会"思考、行动、决定何时说话"。API已上线千问平台,价格最高降幅达95%。
2026年9月23日,阿里在杭州云栖大会(9月22日至24日)上正式发布 Qwen-Audio-3.1 系列。千问官方微博当日官宣,该系列包含 ASR、TTS、Realtime、TTS-Next、ASR-Next 五款模型,其中 Qwen-Audio-3.1-Realtime 定位为全双工实时语音智能体。

官方介绍,这款模型"能同时说和听,可随时插话打断"。与常见的"你一句我一句"式语音对话不同,全双工意味着模型在输出的同时仍能感知环境输入,用户可以随时打断或插入,交互更接近真人对话。
Qwen-Audio-3.1-Realtime 并非只做语音问答。阿里云百炼文档显示,qwen-audio-3.1-realtime-plus 的上下文窗口为 262,144 tokens,其中输入 245,760、输出 16,384,足以支撑长篇幅的任务型对话。
在工具能力上,官方文档确认该模型支持 Function Calling(函数调用)与 Web search(联网搜索),二者不可同时开启,是否调用由模型自主决定。这意味着模型可以在对话中主动查资料、调工具,而不只是"陪聊"。
该模型的训练思路是 Qwen-Audio-3.1-Realtime 的一大看点。arXiv 技术报告(编号 2609.25176)显示,模型采用 GRPO 多粒度 rollout 进行训练。论文核心框架可概括为三部分:Think(蒸馏)、Act(GRPO 工具使用)、Speak and Coordinate(决定何时或是否说话)。
换言之,模型被训练成先想清楚、再决定是否调用工具、最后判断该不该开口。在作者看来,把"何时说话"纳入模型训练目标,是语音智能体从被动应答走向主动交互的关键一步(作者观点)。
作为端到端语音交互模型,Qwen-Audio-3.1-Realtime 支持 ASR/TTS 一体化、智能语义断句(smart_turn)、语音克隆与声纹锁定(speaker enhancement),可覆盖 30 种语言及 16 种中文方言。
评测数据方面,τ-Voice 任务成功率由 78.4% 升至 82.0%;Full-Duplex-Bench v1.5 对背景语音的响应率则从 73.0% 降至 13.0%,说明模型在嘈杂环境中更少被无关声音干扰,全双工交互更稳定。
在商业化层面,Qwen-Audio-3.1-Realtime 的 API 已上架 千问 AI 平台及阿里云 Model Studio,价格大幅下调,最高降幅达 95%。在作者看来,大幅降价叠加工具调用能力,让这一模型的使用门槛明显降低(作者观点)。
需要注意的是开源情况:DataLearner 将该模型标注为"不开源",目前也未搜到官方开放权重信息;原始页面分类中的"Open Source/Weights"仅为网站栏目,不代表模型开源,相关信息有待官方进一步确认。
据校对信息,arXiv 技术报告 v2 已于 9 月 24 日更新,另有基于 3.0-Realtime 的 Voice Harness 原型同步推进。从发布时间线看,论文提交于 9 月 21 日、正式发布在 9 月 23 日,节奏紧凑。