近日Meta旗下超智能实验室正式推出全新多任务实时语音识别模型Muse Voice Transcribe,该模型可同时支持流式自动语音识别(ASR)、说话人分野、端点检测三类核心语音处理任务,实测词错误率(WER)仅为3.1%,是当前语音AI领域少数可实现单模型覆盖多类实时语音转录需求的开源方案,将显著降低下游场景的部署成本。

在实时语音交互需求爆发的当下,多数企业的落地方案仍采用多模型串联架构:先用端点检测模型判断语音起止,再调用ASR模型转写文本,最后单独部署说话人分类模型标注发言身份,多环节的信息传递不仅拉高了延迟,还容易累积误差导致识别准确率下降。
据行业统计,2026年全球实时语音转写的市场规模已经突破120亿美元,覆盖远程办公、智能客服、车载交互、直播字幕等数十个场景,但现有方案普遍存在部署成本高、延迟超标、准确率不足三大痛点,仅不到30%的企业级用户对现有语音转写服务感到满意。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录