Google发布两款Gemini 3.8 Live模型 面向生产级语音代理场景

配图
2026年9月15日,Google正式推出Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款大模型产品,专门面向生产级语音代理场景打造,采用原生语音转语音技术架构,内置后台工具调用能力,可支持全球97种语言使用需求,为企业级语音交互开发提供了新的底层模型选择。

两款模型核心能力详情

本次发布的两款产品均采用原生端到端语音转语音设计,无需经过“语音识别转文字-大模型文本推理-文字转语音输出”的传统三段式流程,可直接实现语音输入到语音输出的全链路处理,理论上可大幅降低交互延迟,提升对话的自然流畅度。 两款产品均内置后台工具调用功能,开发者无需额外对接第三方插件系统,即可基于模型原生能力实现服务查询、指令执行、信息调取等扩展操作,显著降低语音代理应用的开发复杂度。同时全系列支持97种语言,可覆盖全球绝大多数国家和地区的本地化交互需求,出海企业无需单独进行多语言适配即可快速搭建可用的语音服务。 其中Gemini 3.8 Live Extended Thinking版本额外增加了长链路思考能力,可处理复杂的多轮语音交互请求,适合应对智能客服、售后咨询等需要多轮信息确认、逻辑推导的场景。

当前未披露的核心信息

截至目前,Google官方未说明两款模型的具体推理延迟、单实例并发支持量、商用计费标准等企业级用户核心关注的参数指标,也未提及模型针对低带宽环境、高噪音场景的专项优化方案,相关细节有待后续官方进一步对外公布。此外,官方未提及两款模型是否会开放面向普通个人用户的使用入口,当前仅针对生产级场景开放申请。

行业视角下的产品价值

分析认为,Google本次直接推出面向生产级场景的语音大模型,而非先开放C端测试,侧面说明其对两款模型的稳定性、可用性已经达到商用落地标准的判断。对于语音交互领域的开发者而言,原生语音转语音架构+内置工具调用的组合,可大幅降低企业级语音代理的开发成本,缩短上线周期。 可以推断,后续该系列模型可与Google Flow MusicGemini Omni等Google旗下AI产品能力打通,在语音交互场景中扩展出内容生成、多模态交互等更多复合功能,进一步拓宽应用边界。 从目前披露的信息来看,两款产品的核心优势集中在低开发成本、多语言支持、原生工具调用三个方面,对于有全球化语音代理部署需求的企业来说,是极具吸引力的选项。不过由于核心商用参数尚未披露,其市场竞争力还有待后续落地案例验证。企业在选型阶段也可结合自身的业务场景、成本预算、本地化需求等维度进行综合评估,选择适配的模型版本。 本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。