小米开源CocktailASR-1大模型 破解语音识别鸡尾酒会难题

2026年9月,小米正式开源工业级目标说话人语音识别大模型CocktailASR-1,该模型采用参考声纹定位机制,可在多人混声、高背景噪声环境下精准提取并转录特定说话人语音,破解困扰语音识别行业多年的“鸡尾酒会难题”,为多场景语音交互落地提供成熟的工业级解决方案。

配图

刚在嘈杂的咖啡厅开完远程会的职场人大概率有过类似经历:录音转写出来的内容混杂了邻桌的聊天声、店员的叫号声,自己和同事的发言被拆得七零八落,后期整理的成本甚至比重新听一遍还高。这种“分不清该听谁”的问题,正是自动语音识别(ASR)技术落地民用、工业场景时卡了近十年的核心瓶颈。

“鸡尾酒会难题”得名于人类听觉的特殊效应:人耳可以在多人同时说话的嘈杂酒会环境中,精准过滤掉无关声音,只捕捉自己关注的说话人内容。但此前的传统ASR模型没有“选择性收听”的能力,只能对所有输入音频做全量转录,一旦场景中出现2个以上的说话人,或者有超过50分贝的背景噪声,识别准确率就会从安静环境下的97%骤跌至60%以下。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。