标题:阿里千问发布Qwen3.8-LiveTranslate 同传延迟降至2.3秒并可保留原音色

配图
摘要:阿里千问于2026年9月18日至19日正式发布新一代同声传译大模型Qwen3.8-LiveTranslate(API名qwen3.8-livetranslate-flash-realtime),采用Interleave音频-文本交织架构与Hybrid MoE的Thinker–Talker双模块设计,字均延迟从2.8秒降至2.3秒,新增实时说话人分离、保留原音色、原文译文同帧同出、长上下文消歧四大能力,支持60种源语言识别与29种语言语音输出,API已上线阿里云百炼。

从2.8秒到2.3秒:延迟压缩背后的架构变化

Qwen3.8-LiveTranslate是阿里千问(通义千问团队)推出的新一代同声传译大模型。与上一代产品相比,本次升级最直观的变化在于延迟数据的进一步压缩:字均延迟(LAAL)从2.8秒降至2.3秒。官方信息显示,这一提升得益于模型采用音频-文本交织的Interleave架构,将流式理解、文本输出与语音生成整合为单条因果序列,从而减少了多模块协作带来的额外耗时。 在底层设计上,该模型采用Hybrid MoE的Thinker–Talker双模块架构。其中,Thinker模块负责理解源语言并完成翻译,Talker模块则负责合成译文语音。两个模块各司其职,共同支撑起整套同传流程。可以推断,这种分工明确的架构设计,是模型得以在压缩延迟的同时维持翻译与语音合成质量的关键原因。

四大新增能力:从声音归属到上下文消歧

本次升级的核心看点集中在四项新能力的引入上,它们分别对应同传场景中不同环节的痛点。 首先是实时说话人分离。在多人交替发言的会议场景中,模型能够对每一句话进行说话人归属识别,使译文与发言人对应关系清晰可辨。此前同传系统在处理多人对话时,输出声音常出现混叠或归属模糊的问题,这一能力的加入直接回应了该场景下的实际需求。 其次是保留原音色。模型在输出译文语音时,可以稳定保留原说话人的音色特征。这意味着听众在听到译文的同时,依然能通过声音辨识出是哪位发言人在讲话,而非统一使用预设的合成音色。这一功能在同传场景中具备较高的实用价值。 第三项能力是原文译文同帧同出。译文语音与字幕同步输出,实现双语同屏显示,让听众既能即时理解译文内容,也能对照原文进行核对,兼顾理解效率与信息的准确性。 第四项能力是长上下文消歧。模型通过跨轮关联历史语境,对专有名词、指代关系等容易产生歧义的内容进行综合判断,从而减少翻译中因缺乏上下文而导致的理解偏差。

评测表现与语言覆盖

在评测层面,官方信息显示,Qwen3.8-LiveTranslate在覆盖14个语向的多说话人长音频评测集Omnilingua-MSpeaker上,于忠实度、流畅度、简洁度及说话人分离错误率(DER)四项指标上均优于主流同传系统。此外,该模型还通过了FLEURS评测集的70个语向评测。 语言覆盖方面,该模型支持60种源语言的语音识别,以及29种语言的语音输出。相较上一代qwen3-livetranslate-flash-realtime(2026年5月上线,支持18种语言、约3秒延迟),本次迭代在语种数量和响应速度上均有明显扩展。模型基于Qwen-Omni多模态基础设施构建,面向会议同传、直播字幕、视频本地化等应用场景。

API已上线,采用闭源付费模式

与上一代产品一样,Qwen3.8-LiveTranslate并未选择开源路线,而是以付费API的形式对外提供服务。目前,该模型的实时接口已在千问AI平台及阿里云百炼上线,覆盖北京与新加坡地域,支持WebSocket方式接入。用户如需调用,可通过API名qwen3.8-livetranslate-flash-realtime进行访问。 阿里云帮助中心于9月18日更新了该模型的计费信息:以北京地域为例,音频输入价格为40元/百万tokens,音频输出价格为160元/百万tokens,上下文窗口为53K tokens。在限流方面,该API的RPM限制为10,TPM限制为100,000。官方未说明上述限流策略是否会随模型迭代而后续调整。 从翻译质量的提升到延迟的进一步压缩,再到对说话人分离和原音色保留等细节能力的打磨,可以看出阿里千问在同传这一垂直方向上正沿着「更自然、更精准」的路线推进迭代。QwenWork、QwenPaw等周边工具的陆续完善,也在一定程度上反映出其在AI应用层面的整体布局。对于高频使用同传服务的跨国会议、直播和视频制作场景而言,这类模型的每一次能力更新,都意味着实际体验的又一次重估。

参考资料

  1. 【千问发布 Qwen3.8-LiveTranslate,同传延迟降至_凤凰网 - 凤凰网科技
  2. 驱动中国官方的微博 - 微博
  3. 实时语音/音视频翻译-千问 - 阿里云帮助中心
  4. Qwen3.8-LiveTranslate同声传译模型发布 - 虎嗅网 - 虎嗅网
  5. qwen3.8-livetranslate-flash-realtime 模型信息-大模型服务平台百炼(Model Studio)-阿里云帮助中心 - 阿里云帮助中心
  6. 千问新同传模型延迟降至2.3秒,新增保留音色能力API已上线-太平洋科技 - 太平洋科技
  7. 阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,支持原文译文同帧同出|IT之家|Qwen 3|音频|错误率|和源_手机新浪网 - 新浪财经
  8. Qwen3.8-LiveTranslate:实时同声传译模型,60 种语言 2.3 秒延迟 | DataLearner - DataLearner AI
  9. 阿里千问发布实时同传大模型Qwen3.8-LiveTranslate- DoNews快讯 - DoNews
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。