语音AI服务商Superwhisper近期正式开源轻量文本归一化模型S1-mini,该模型参数规模0.6B、体积仅462MB,可在端侧本地运行,直接将语音识别(ASR)输出的原始转写文本整理为通顺规范的书面文本。同时Superwhisper还推出两款云端版S1大模型,覆盖从个人开发者到大型企业的不同层级语音转写后处理需求,为端侧语音AI落地降低了技术门槛。
经常使用语音转文字功能的用户大概率有过类似体验:原始转写结果里堆满了“嗯”“啊”之类的语气助词、语序混乱的口语表达,甚至大量同音字错误,手动修正的时间往往比听录还长。这一长期制约语音识别落地体验的痛点,如今有了更轻量化的解决方案。
随着语音识别(ASR)技术的普及,当前通用场景下的ASR识别准确率已经突破98%,但原始转写结果的文本归一化始终是体验短板:规则驱动的修正方案适配性差,遇到口音、专有名词、口语化表达时错误率极高;基于大模型的修正方案参数规模普遍在10B以上,只能部署在云端,不仅延迟高,还存在数据上传的隐私风险,端侧硬件根本无法承载,不少消费级语音产品厂商长期在体验和成本之间两难。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录