Gradium AI发布新一代TTS模型 硬场景通过率达81%时延216ms

语音AI厂商Gradium AI于近期发布新一代默认文本转语音(TTS)模型,该模型在行业通用的高难度测试用例集上通过率达81.0%,首音频生成时延(TTFA)仅216毫秒,两项核心指标均优于当前市场主流竞品Cartesia、ElevenLabs的同类型产品,有望重构实时语音交互场景的技术选型标准。

配图

过去两年,TTS技术的落地边界不断拓宽,已经覆盖AI语音助手、数字人直播、实时同传、有声内容生成等多个场景。但行业始终面临一个共性难题:如果要保障复杂场景下的发音准确率、情感自然度,往往需要更长的推理时间,导致首句响应时延超过500毫秒,用户能明显感知到卡顿;如果优先压缩时延,又会导致生僻词、多语种混读、多音字歧义等“硬场景”下的错误率飙升,不少虚拟主播、AI客服频频出现读错专业术语、语气违和的翻车事故。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。