
2026年7月29日,语音AI厂商Fish Audio在成立周年之际正式推出生产级实时对话语音大模型S2.1Pro。该模型首帧延迟仅约90毫秒,覆盖83种语言,支持细粒度情绪控制、耳语生成、多说话人对话及10-30秒短样本语音克隆,目前已通过API上线并提供免费测试额度,为AI实时交互场景提供了更高性能的技术方案。
在实时语音交互场景中,100毫秒是用户感知不到延迟的临界阈值——此前多数商用TTS产品的首帧延迟普遍在300毫秒以上,对话中频繁出现的抢话、停顿感,一直是限制多模态AI落地的核心痛点之一。
随着大语言模型的普及,AI虚拟伴侣、智能客服、实时同传、线上虚拟会议等场景对语音交互的自然度要求持续提升,传统针对脚本旁白、有声书制作开发的TTS系统,无论在响应速度还是灵活性上都已经无法匹配需求,行业亟需专门为对话场景打造的语音大模型。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录