2026年9月,Meta正式推出旗下首个实时音频感知模型Muse Voice Transcribe,该模型整合流式语音识别、说话人分离、端点检测三大核心能力,支持20余名说话人同时发言时分轨转写,训练覆盖70余种语言,开发者可通过Meta Model API调用,定价为每千分钟音频3美元,较同类产品具备显著成本优势,可广泛应用于会议记录、实时字幕等场景。

多人会议转写的痛点已经存在多年:传统语音转写工具要么需要等待整场会议结束才能输出完整文本,延迟极高;要么最多只能区分5-10个发言者,遇到大型研讨会、圆桌论坛这类多人同场的场景,转写结果往往混乱不堪,需要人工花费数小时校对,效率极低。
Muse Voice Transcribe的核心优势,是将原本需要独立调用的流式自动语音识别、说话人分离、端点检测三大能力整合到了同一计算流程中,不再需要分步处理音频数据。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录