OpenAI开放GPT-Live-1 API 全双工语音交互落地商用服务场景

2026年9月11日,OpenAI正式宣布将GPT-Live-1实时语音模型接入官方API,该模型支持全双工对话、打断识别、背景噪声过滤,可直接适配电话客服、预约办理等商用场景,同时支持对接Codex工具链与OpenAI Presence企业接口,能实现企业系统查询、获批操作执行等自动化流程,大幅降低实时语音应用开发门槛。

配图

在实时语音交互领域,传统“语音转文字(ASR)+大语言模型+文字转语音(TTS)”的三段式架构始终存在体验短板:普遍2秒以上的响应延迟、无法流畅处理用户中途打断、背景噪声下识别准确率大幅下跌,这些问题让AI语音助手的商用体验始终达不到企业预期,尤其是对交互流畅度要求极高的电话客服、线下服务场景,此前一直缺乏成熟的标准化解决方案。

GPT-Live-1采用端到端的语音整合架构,将语音理解和语音输出模块整合在同一个模型体系内,跳过了传统方案中多次格式转换的衔接环节,从根源上压缩了交互延迟。同时该模型支持全双工交互模式,可实现边听边说的类真人对话体验,不仅能自然处理用户中途打断、思考停顿等常见对话场景,还自带背景噪声过滤能力,可适配电话线路杂音、公共环境嘈杂等复杂使用场景。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。