阿里发布千问全双工语音模型Qwen-Audio-3.1

摘要:阿里于2026年9月23日在云栖大会发布Qwen-Audio-3.1系列,其中Qwen-Audio-3.1-Realtime为全双工实时语音模型,能同时听说、随时插话打断,具备262K上下文、工具调用与联网搜索能力,并通过GRPO训练学会"思考、行动、决定何时说话"。API已上线千问平台,价格最高降幅达95%。

云栖大会官宣:全双工实时语音模型正式亮相

2026年9月23日,阿里在杭州云栖大会(9月22日至24日)上正式发布 Qwen-Audio-3.1 系列。千问官方微博当日官宣,该系列包含 ASR、TTS、Realtime、TTS-Next、ASR-Next 五款模型,其中 Qwen-Audio-3.1-Realtime 定位为全双工实时语音智能体。

配图

官方介绍,这款模型"能同时说和听,可随时插话打断"。与常见的"你一句我一句"式语音对话不同,全双工意味着模型在输出的同时仍能感知环境输入,用户可以随时打断或插入,交互更接近真人对话。

262K上下文:从"对话"走向"任务"

Qwen-Audio-3.1-Realtime 并非只做语音问答。阿里云百炼文档显示,qwen-audio-3.1-realtime-plus 的上下文窗口为 262,144 tokens,其中输入 245,760、输出 16,384,足以支撑长篇幅的任务型对话。

在工具能力上,官方文档确认该模型支持 Function Calling(函数调用)与 Web search(联网搜索),二者不可同时开启,是否调用由模型自主决定。这意味着模型可以在对话中主动查资料、调工具,而不只是"陪聊"。

GRPO训练:学会"思考、行动、决定何时说话"

该模型的训练思路是 Qwen-Audio-3.1-Realtime 的一大看点。arXiv 技术报告(编号 2609.25176)显示,模型采用 GRPO 多粒度 rollout 进行训练。论文核心框架可概括为三部分:Think(蒸馏)、Act(GRPO 工具使用)、Speak and Coordinate(决定何时或是否说话)。

换言之,模型被训练成先想清楚、再决定是否调用工具、最后判断该不该开口。在作者看来,把"何时说话"纳入模型训练目标,是语音智能体从被动应答走向主动交互的关键一步(作者观点)。

端到端语音能力与评测提升

作为端到端语音交互模型,Qwen-Audio-3.1-Realtime 支持 ASR/TTS 一体化、智能语义断句(smart_turn)、语音克隆与声纹锁定(speaker enhancement),可覆盖 30 种语言及 16 种中文方言。

评测数据方面,τ-Voice 任务成功率由 78.4% 升至 82.0%;Full-Duplex-Bench v1.5 对背景语音的响应率则从 73.0% 降至 13.0%,说明模型在嘈杂环境中更少被无关声音干扰,全双工交互更稳定。

API上线与最高95%降价:商业化加速

在商业化层面,Qwen-Audio-3.1-Realtime 的 API 已上架 千问 AI 平台及阿里云 Model Studio,价格大幅下调,最高降幅达 95%。在作者看来,大幅降价叠加工具调用能力,让这一模型的使用门槛明显降低(作者观点)。

需要注意的是开源情况:DataLearner 将该模型标注为"不开源",目前也未搜到官方开放权重信息;原始页面分类中的"Open Source/Weights"仅为网站栏目,不代表模型开源,相关信息有待官方进一步确认。

后续动态

据校对信息,arXiv 技术报告 v2 已于 9 月 24 日更新,另有基于 3.0-Realtime 的 Voice Harness 原型同步推进。从发布时间线看,论文提交于 9 月 21 日、正式发布在 9 月 23 日,节奏紧凑。

参考资料

  1. qwen-audio-3.1-realtime-plus-Alibaba Cloud Model Studio(Model Studio)-阿里云帮助中心 - 阿里云帮助中心
  2. Qwen-Audio real-time voice model-Alibaba Cloud Model Studio(Model Studio)-阿里云帮助中心 - 阿里云帮助中心
  3. 阿里发布语音模型系列Qwen-Audio-3.1_新浪财经_新浪网 - 新浪财经
  4. Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction - arXiv
  5. 🎧五模齐发!能听懂、能创作、能聊天今天,我们正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级覆盖语音识别(ASR)、语音合成(TTS)与实时语音交互(Realtime)三大核心模型,并全新推出音频创作模型 TTS-Next 与音频理解模型 ASR-Next。五款模型同时推出,形成一套覆盖“理解—生成—交互— ​|千问大模型|qwen-audio-3.1|语音识别|语音合成|实时交互|音频创作_新浪新闻 - 手机新浪网
  6. [2609.25176v1] Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction - arXiv
  7. [PDF] Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction | Semantic Scholar - Semantic Scholar
  8. Qwen-Audio-3.1-Realtime:评测、参数与模型卡 | DataLearnerAI - DataLearner AI
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。