OpenAI发布全双工语音模型GPT-Live-1 实现类人流畅语音交互

美国人工智能公司OpenAI于2026年9月正式发布全双工语音模型GPT-Live-1,该模型采用单一架构替代传统语音转文字、推理、文字转语音的级联流程,大幅降低交互延迟,可流畅应对打断、话题切换等复杂场景,早期测试中可减少80%停顿期间的交互中断。目前该模型已上线API面向开发者开放。

配图

对于常年使用AI语音助手的用户来说,“等回复”“打断无效”“话题跳转后答非所问”几乎是普遍的槽点:传统语音交互的级联式流程需要依次完成语音识别、语义推理、语音合成三个独立步骤,哪怕每一步仅耗时数百毫秒,叠加后也会产生可感知的延迟,一旦遇到用户中途插话、思考停顿等情况,整个交互链路很容易出现错乱。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。