2026年8月14日,通用人工智能公司MiniMax正式推出新一代音乐生成模型MiniMax-Music3,用户仅需输入歌词与风格描述即可生成最长5分钟的完整歌曲,输出32kHz、16-bit立体声WAV文件。该模型采用分层自回归架构,基于Qwen3-8B初始化的8B全局LLM搭配0.6B局部LLM,兼顾长程结构把控与声学细节还原。

很长一段时间里,AI生成音乐始终逃不开“片段化”“结构崩”的通病:大多数模型生成上限仅为1-2分钟,一旦拉长时长就会出现曲风跑偏、人声突变、段落逻辑混乱等问题,始终无法满足专业创作的基本需求。而MiniMax此次发布的Music3,正是瞄准这一行业痛点给出的解决方案。
此次Music3的核心创新就是分层自回归架构,摒弃了单一模型兼顾结构与细节的传统路线,将生成任务拆分给两个参数规模差异极大的模型:其中8B参数的全局LLM由Qwen3-8B初始化而来,负责逐帧预测首个RVQ码本,专门把控歌曲的长程语义与结构逻辑,能让生成内容在5分钟时长内始终保持主题、节奏、人声身份的一致性,完整覆盖前奏、主歌、预副歌、桥段等流行音乐全段落结构。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录