
阿里通义实验室近日正式发布全新语音合成模型Qwen-Audio 3.0 TTS,同步推出Flash、Plus两个服务层级,支持全球16种语言的语音生成,内置自然语言风格控制、行内标签调节等差异化能力,可满足不同场景下的低延迟、高拟真语音合成需求,为开发者提供了更灵活的语音技术选型。
随着AIGC应用的规模化落地,语音合成(TTS)已经成为内容生产、智能交互领域的刚需能力。过往行业供给大多走单一性能路线:要么主打低延迟牺牲音质,要么主打高拟真牺牲响应速度,开发者很难在不同场景下找到适配的低成本方案,这一空白也成为头部AI实验室的技术落地突破口。
本次推出的Qwen-Audio 3.0 TTS专门针对场景差异做了版本拆分。Flash版本主打极低延迟,输出响应速度适配实时交互类场景,比如直播实时字幕配音、智能硬件语音回复、在线客服语音播报等,无需提前缓存就能做到流畅输出。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录