2026年9月11日,OpenAI正式上线全新实时语音模型GPT-Live-1的API服务。该模型首次实现语音理解与输出在同一架构内整合,打破传统“语音转文字-大模型推理-文字转语音”的三段式处理流程,支持全双工对话、打断处理、工具调用与电话智能体配置,大幅降低交互延迟,标志着AI语音交互正式从分段处理向自然对话阶段演进。

对于不少对接过AI语音服务的开发者而言,传统实时对话方案的体验短板一直是落地难点:分段式处理带来的数百毫秒延迟让对话总有“卡顿感”,系统无法识别用户中途打断的指令,面对背景杂音、用户停顿等场景还经常出现应答错乱,最终上线的智能语音服务往往被用户吐槽“太像机器人”。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录