科大讯飞发布Spark-Audio语音大模型 全国产算力覆盖99种语言202种方言

2026年9月16日,科大讯飞正式发布语音基座大模型Spark-Audio-1.0-Preview。该模型基于全国产算力训练完成,可有效降低供应链风险,支持语音、文本双模态输入与文本输出,覆盖99种语言、202种方言识别,具备语音转写、情感分析、音频问答等多项智能语音能力。

配图

底层架构:全栈国产化算力支撑

本次发布的Spark-Audio-1.0-Preview最核心的差异化特征就是全国产属性:模型训练全程基于国产化算力完成,从技术底层就规避了供应链不稳定带来的潜在风险。

能力覆盖:实现“听清”到“听懂”的跃升

功能层面,该模型支持语音、文本双模态输入,输出为文本模态,可覆盖多类智能语音应用场景。基础能力包含语音转写、多语言翻译、多方言识别,进阶能力覆盖环境音识别、说话人识别、情感分析以及复杂音频问答。

官方公开信息显示,该模型目前已经实现99种语言、202种方言的识别覆盖。科大讯飞方面表示,这一能力标志着智能语音技术的迭代方向:过去行业聚焦于将声波准确转写为文字,而新模型已经可以识别说话人身份、语音情绪、背景环境音等多维信息,完成从“听清”到“听懂”的跨越。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。