登录体验完整功能(收藏、点赞、评论等) — 已累计有 13265 人加入

PolyAI发布Dialog-RSN-1音频原生对话模型 延迟低至300毫秒内

详情页推荐

对话AI厂商PolyAI于近日推出全新音频原生对话模型Dialog-RSN-1,该模型首次将话轮转换、语音识别、函数调用、自然语言响应生成四大能力整合至单一架构,无需多模块串联即可完成全链路语音交互,端到端延迟控制在300毫秒以内,大幅降低语音交互卡顿感,为智能客服、车载语音等场景提供了新的技术选型。

不少用户在使用车载语音、智能客服等语音交互产品时,都遇到过“指令说完等1秒才反应”“中途插话被系统忽略”的糟糕体验——这种体验短板的核心原因,是传统语音交互方案依赖ASR(自动语音识别)、大语言模型、TTS(语音合成)等多个独立模块串联调用,链路损耗叠加后延迟普遍超过1秒,很难达到真人对话的流畅度。

过去几年行业针对单个模块的优化已经接近瓶颈,ASR识别延迟已经压缩到百毫秒级,但多模块串联的架构问题没有解决,端到端延迟就很难降到用户无感知的水平,这也成为语音交互在很多高频场景渗透率不足的核心阻碍。

尤其是对实时性要求极高的车载、金融客服等场景,超过1秒的延迟不仅会降低使用体验,甚至可能带来驾驶安全、客户流失等实际损失,行业始终期待能从架构层面解决延迟问题的方案。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。