AIGCPanel v2.5.0发布:接入云端语音,音色分库管理

核心摘要

AIGCPanel v2.5.0于2026年9月28日发布,在“其他模型”入口接入火山引擎豆包语音与阿里云百炼DashScope(qwen-tts)。用户填入API Key后,系统先用“你好,这是一段语音试听。”校验接口连通性,本地无专业GPU也可使用云端语音合成。新版本还将数字人与直播音色分库管理,并新增直播模型控制区与实时日志。

配图

两条云端语音线路接入桌面端

AIGCPanel是一款开源一站式AI数字人桌面应用,支持Windows、macOS和Linux,功能覆盖数字人合成、语音合成与克隆、工具箱和智能直播。2026年9月28日,该产品发布v2.5.0版本。

此次更新在AI模型页的“其他模型”入口接入两类云端语音服务:火山引擎豆包语音,以及阿里云百炼DashScope提供的qwen-tts模型。用户只需填入对应API Key,即可启用云端语音模型。

根据火山引擎官方文档,豆包语音是新一代大模型语音合成服务,支持流式与非流式API,提供325个大模型音色;接口鉴权使用请求头中的x-api-key。阿里云qwen-tts为中国北京区域模型,输入价格为1.6元/百万token,输出音频价格为10元/百万token。

为降低配置门槛,软件在保存Key前会先合成一句“你好,这是一段语音试听。”,确认接口连通后才允许保存。底层则由主进程维护语音provider注册表,厂商将HTTP接口适配为统一的soundTts调用即可接入。其中,豆包语音返回多段JSON拼接的单向流,软件需按分片解析后再合并。

补齐无显卡用户的语音方案

AIGCPanel官网FAQ确认,电脑没有专业GPU,也可以使用云端AI模型服务。这意味着本地缺乏显卡的用户,可通过豆包语音或qwen-tts完成高质量语音合成。

此前,AIGCPanel已支持MuseTalk、LatentSync、Wav2Lip、Heygem、CosyVoice、IndexTTS等本地模型。校对信息显示,v2.3.0已上线API服务,v2.5.0则是在此基础上的又一次云端化升级。更早的v2.0于2026年6月引入可视化工作流引擎,v2.4.0上线了绿幕换背景与歌曲翻唱功能。

数字人与直播音色拆分为两套独立库

v2.5.0将音色拆分为语音音色(SoundVoice)与直播音色(LiveVoice)两套独立库。两套音色分表存储、互不干扰,底层由VoiceService工厂统一管理,以适配数字人合成和智能直播两类场景。

直播侧还新增了“模型控制”区域,用户可以启动或停止模型,并查看实时日志,便于直接掌握直播模型的运行状态。

作者观点

在笔者看来,AIGCPanel v2.5.0的重点不是简单增加两个语音接口,而是把API Key配置、连通性校验、云端语音调用、音色分库和直播日志整合进同一桌面工作流。对无专业GPU的用户而言,这降低了使用高质量语音合成的门槛。但这只是AIGCPanel单产品的一次云端化更新,不能据此推断整个数字人软件行业都会采用相同路径。

参考资料

  1. AIGCPanel v2.5.0 支持豆包语音音色,数字人直播音色模板管理 - OSCHINA - 开源 × AI · 开发者生态社区 - OSCHINA
  2. Model Download|AIGCPanel - AigcPanel
  3. 产品简介--豆包语音-火山引擎 - 火山引擎
  4. qwen-tts Model Info-Alibaba Cloud Model Studio(Model Studio)-阿里云帮助中心 - 阿里云帮助中心
  5. AIGCPanel v2.0 从拖拽到成片,不再只是个数字人工具 - AigcPanel
  6. ListAPIKeys - 拉取APIKey列表--豆包语音-火山引擎 - 火山引擎
  7. AIGCPanel | 开源AI数字人系统 - AigcPanel
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。