科技巨头英伟达近日正式发布开源全双工语音转语音大模型NemotronLabs VoiceChat 11B,该模型单次交互轮转时延低至448毫秒,同时支持实时工具调用功能,可实现接近自然人对话节奏的语音交互能力,为AI语音助手、智能座舱、数字人等场景的体验升级提供了全新底层技术方案。过去几年AI语音交互产品已经广泛落地,但用户体验始终存在明显短板:传统方案采用“ASR语音识别-大语言模型推理-TTS语音合成”的串行链路,普遍存在1.5秒以上的交互时延,且大多为半双工模式,用户无法随时打断、插话,对话节奏生硬,与真人面对面交流的体验差距极大。在智能座舱、实时客服、数字人直播等对交互流畅度要求极高的场景,时延问题已经成为产品体验升级的核心阻碍。此次英伟达推出的NemotronLabs VoiceChat 11B,采用了端到端的全双工语音转语音架构,跳过了文本中转的冗余环节,直接实现语音输入到语音输出的链路打通,实测单次交互轮转时延低至448毫秒,不到半秒的响应速度已经接近普通人对话的反应节奏。110亿参数的规模设计,兼顾了模型效果和推理成本,同时支持实时工具调用能力,用户在对话过程中即可触发...