Meta发布首款实时音频感知模型 支持20人同场转写每千分钟3美元

2026年9月,Meta正式推出旗下首个实时音频感知模型Muse Voice Transcribe,该模型整合流式语音识别、说话人分离、端点检测三大核心能力,支持20余名说话人同时发言时分轨转写,训练覆盖70余种语言,开发者可通过Meta Model API调用,定价为每千分钟音频3美元,较同类产品具备显著成本优势,可广泛应用于会议记录、实时字幕等场景。

配图

多人会议转写的痛点已经存在多年:传统语音转写工具要么需要等待整场会议结束才能输出完整文本,延迟极高;要么最多只能区分5-10个发言者,遇到大型研讨会、圆桌论坛这类多人同场的场景,转写结果往往混乱不堪,需要人工花费数小时校对,效率极低。

Muse Voice Transcribe的核心优势,是将原本需要独立调用的流式自动语音识别、说话人分离、端点检测三大能力整合到了同一计算流程中,不再需要分步处理音频数据。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。