
2026年7月31日,阿里巴巴正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,该模型针对专业词汇识别做了系统性优化,内置覆盖医疗、IT、金融等多领域的高质量词库,医疗场景词汇听中率达95.36%。此前该系列模型曾在国际评测平台Artificial Analysis上以1.7%的错字率拿下全球第一,目前已落地多个商用场景。

长期以来,专业场景的语音转写始终是AI语音识别的核心痛点:生僻的医疗术语、行业专属缩写、随时迭代的产业热词,往往会让通用语音识别模型出现大量错漏,不少场景下人工修正的成本甚至超过转写本身,专业级语音识别的准确率也成为行业公认的技术门槛。
本次推出的Qwen-Audio-3.0-ASR-Flash,核心优化方向正是解决专业词汇识别不准的问题。研发团队在上下文一致性、行业词识别、热词定制化三个维度做了系统性升级,同时内置了语音润色模块,可自动过滤语气词、调整语序,直接输出逻辑通顺的结构化文本。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录