
2026年7月20日,大模型厂商千问正式推出新一代语音合成大模型Qwen-Audio-3.0-TTS,主打Free-style自然语言指令控制,用户无需调整复杂工程参数即可生成指定语气、风格的语音内容。该模型设置双版本适配不同场景,其中面向实时交互的Flash版本首包延迟低至300毫秒,Plus版本主打高音质表现力,覆盖多领域语音生成需求。

不少做有声书的中小创作者都算过一笔账:过去为了调出符合角色设定的语音效果,单条15分钟的音频往往要花近1小时调整参数,人力成本几乎占到内容生产总成本的60%。而这类困扰整个语音合成领域的效率问题,正在被新的技术方案彻底解决。
过去很长一段时间,语音合成的使用门槛一直卡在专业参数调节环节。不管是面向C端的配音工具,还是面向B端的语音助手解决方案,用户想要得到符合预期的语音效果,需要对语速、语调、停顿、情感权重等多个参数进行反复调试,普通用户往往需要数个小时的学习才能入门,专业创作者也常因参数调整消耗大量不必要的时间。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录