2026年8月4日,腾讯混元正式发布新一代语音识别模型Hy ASR 3.0 preview。该模型依托自研Hy3大语言模型的深度理解能力,融合高精度声学识别与语义感知能力,在多语种、多场景测试中词错误率(WER)普遍降至3%上下,其中中文普通话3.34%、英语2.62%、粤语3.12%,实现语音识别从逐字转写到语义理解的代际升级。过去数十年,语音识别技术的迭代始终围绕“逐字准确率”做单点优化,依赖声学模型匹配发音特征,一旦遇到高噪环境、轻声耳语、带口音的普通话、对话中的省略指代、行业专属术语,转写结果往往错漏百出,需要人工花费大量时间后期校对,在会议记录、智能客服、车载交互等高频场景的实际体验始终差强人意。此次发布的Hy ASR 3.0 preview跳出了传统ASR的优化逻辑,直接将Hy3大语言模型的全域语义理解能力与语音识别链路深度融合,不再孤立识别单句发音,而是结合上下文语境判断用户真实表达意图,甚至可以自动修正同音字错误、补全省略的指代信息。官方公布的测试数据显示,在海外开源评测集上,该模型的多语种词错误率(WER)均控制在3%左右,其中中文普通话3.34%、英语2.62%、粤...