美国人工智能公司OpenAI于2026年9月正式发布全双工语音模型GPT-Live-1,该模型采用单一架构替代传统语音转文字、推理、文字转语音的级联流程,大幅降低交互延迟,可流畅应对打断、话题切换等复杂场景,早期测试中可减少80%停顿期间的交互中断。目前该模型已上线API面向开发者开放。

对于常年使用AI语音助手的用户来说,“等回复”“打断无效”“话题跳转后答非所问”几乎是普遍的槽点:传统语音交互的级联式流程需要依次完成语音识别、语义推理、语音合成三个独立步骤,哪怕每一步仅耗时数百毫秒,叠加后也会产生可感知的延迟,一旦遇到用户中途插话、思考停顿等情况,整个交互链路很容易出现错乱。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录