科大讯飞上线星火语音基座大模型 采用纯国产算力训练

2026年9月16日,科大讯飞正式上线讯飞星火Spark-Audio-1.0-Preview语音基座大模型。该模型采用0.65B Dense结构音频编码器搭配30B MoE架构,完全基于纯国产算力训练,可突破传统音频处理级联方案的固有短板,实现对语音信号的端到端直接理解。

配图

传统音频处理的固有局限

过往大模型处理音频普遍采用级联方案,核心流程为“语音转文字-文字输入大模型理解”,这种处理路径存在两个难以规避的缺陷。一是信息丢失,文字载体仅能记录说话的具体内容,语音自带的语气、情绪属性,以及背景环境音等关键信息都会被过滤,直接影响模型对场景判断的完整性。二是链路割裂,语音转写、声纹识别、语音翻译等能力被拆分为独立模块串联运行,模块衔接处存在断点,不仅容易累积错误,还会导致使用过程中出现延迟、卡顿等体验问题。

新语音基座的技术路径升级

此次上线的Spark-Audio-1.0-Preview语音基座大模型,彻底摒弃了“先转写再理解”的传统路径,不需要经过文字转写环节,可直接对语音信号进行解析。该模型可一次性完成对人声、环境音、音乐等多种声音信号的识别,同时能精准捕捉并理解声音中承载的语义、情绪及对应场景信息。硬件层面,该模型完全基于纯国产算力完成训练,采用0.65B Dense结构的音频编码器,搭配30B MoE架构,硬件与技术路径的适配性更强。

应用价值推测

可以推断,该语音基座大模型的落地,有望提升对语音交互精度、响应速度要求较高的场景的使用体验,降低多模块衔接带来的体验损耗。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。