Music3一口气写完5分钟歌

MiniMax 8月14日发布音乐生成模型 MiniMax-Music3,以8B全局模型和0.6B局部模型分工生成最长5分钟、32kHz立体声完整歌曲。
MiniMax-Music3 发布:AI 音乐开始挑战完整歌曲
MiniMax 今天(2026 年 8 月 14 日)发布了音乐生成模型 MiniMax-Music3,用户输入歌词和音乐描述,即可生成最长 5 分钟的完整歌曲。与一两分钟的音乐片段相比,Music3 这次真正想解决的不是“能不能发声”,而是 AI 能否在一首歌的尺度里维持主题、节奏、人声和编曲逻辑。
**MiniMax-Music3 是一款面向完整歌曲生成的音乐模型,能够把歌词与风格描述转换为最长 5 分钟的带人声、伴奏和段落结构的音频。**官方披露的输出规格为 32kHz、16-bit、双声道 WAV,歌曲结构可覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏。

从60秒到5分钟,关键不是简单延长进度条
**Music3 将 MiniMax 单次音乐生成时长从早期 music-01 的 60 秒提高至 300 秒,名义时长扩大了 5 倍。**MiniMax 在 2024 年发布首款端到端音乐模型 music-01 时,公开能力上限还是 60 秒,并预告后续版本将扩展到 180 秒;Music3 现在直接把上限推到了 5 分钟。
| 对比维度 | MiniMax music-01(2024年发布时) | MiniMax-Music3(2026年8月) | |---|---:|---:| | 最长生成时长 | 60 秒 | 300 秒 | | 时长变化 | 基准 | 提升至 5 倍 | | 输入方式 | 歌词、参考音乐等 | 歌词与音乐描述 | | 输出内容 | 人声与伴奏,可生成纯音乐、清唱 | 完整人声、伴奏与多段式歌曲 | | 结构控制 | 官方当时未详细披露 | 前奏、主歌、预副歌、副歌、桥段、间奏、尾奏 | | 输出规格 | 公开资料未明确 | 32kHz、16-bit、立体声 WAV | | 核心架构 | 未在本次资料中披露 | 8B Global LLM + 0.6B Local LLM |
**长音频生成的难点是保持全局一致性,而不是机械地产生更多音频采样点。**一段 30 秒的音乐只要旋律顺耳、人声没有明显破音,就可能让人觉得“效果不错”;一首 5 分钟的歌则必须回答更多问题:第二遍副歌是否还是同一个主题,主唱音色会不会中途换人,桥段是否真的形成转折,尾奏能否自然收束,以及配器有没有随着段落推进,而不是循环同一段伴奏。
**完整歌曲生成因此更接近长篇写作,而不是把短视频配乐复制十遍。**模型既要记住前文,又要在合适的位置制造变化。主题完全不变,听感会像无限循环;变化过多,作品又会像几首歌被强行拼接。Music3 的主要技术卖点,正是把“记住什么”和“补出什么”拆给两个不同规模的模型处理。
8B管结构,0.6B管声音细节
**分层自回归架构是一种把音乐的长期结构和短期声学细节分层预测的生成方式。**MiniMax-Music3 没有让单个模型同时承担作曲、编曲、人声连续性和每一帧声音纹理,而是使用 Global LLM 与 Local LLM 两级模型协同工作。
| 模块 | 参数规模 | 主要任务 | 可以类比为 | |---|---:|---|---| | Global LLM | 8B | 逐帧预测第一个 RVQ 码本,建模主题、段落和长程结构变化 | 作曲人兼制作统筹 | | Local LLM | 0.6B | 预测每帧其余声学码本,恢复音色、质感等细节 | 录音师与声音工程师 | | 两者合计 | 约 8.6B | 分层完成语义规划与声学还原 | 先搭歌曲骨架,再填充声音细节 |
**Global LLM 是负责歌曲全局语义和结构规划的 80 亿参数语言模型。**它逐帧预测第一个 RVQ 码本,重点处理旋律主题如何延续、段落何时切换、编曲如何推进,以及歌声身份能否在长时间范围内保持稳定。
**Local LLM 是负责补全局部声学信息的 6 亿参数模型。**它预测同一帧中剩余的声学码本,把全局模型确定的音乐骨架还原成更细致的人声、乐器、空间感和音色纹理。0.6B 的参数量明显小于 Global LLM,也说明系统把大部分推理能力投入到了长期规划,而非重复处理所有细节。
**RVQ 是 Residual Vector Quantization(残差向量量化)的缩写,它会用多层离散码本逐级表示音频。**第一个码本可以理解为一张低分辨率但结构清楚的草图,后续码本则不断补充轮廓、纹理和细节。Music3 先让 8B 模型守住“这首歌在唱什么、接下来往哪里走”,再由 0.6B 模型回答“这一帧具体应该怎样响”。
**这套架构的价值在于避免让大模型把算力浪费在所有声学细枝末节上。**如果完全由一个大型自回归模型连续预测全部音频码本,5 分钟歌曲会带来很长的生成序列,推理成本和误差累积都更难控制;分层生成则相当于先压缩决策空间,再恢复声音细节。
Qwen3-8B提供了起点,但它不是直接拿来写歌
**Music3 的 Global LLM 基于 Qwen3-8B 初始化,这意味着模型继承了成熟语言模型的参数起点,而不是从随机参数开始训练。**根据官方技术说明,MiniMax 先适配音乐语义词元对应的嵌入层和输出层,再让 Global LLM 与 Local LLM 联合建模全部 RVQ 码本。
**基于 Qwen3-8B 初始化不等于让文本模型直接预测 WAV 波形。**文本大模型原本处理的是文字 token,而 Music3 需要处理离散化后的音乐 token;两者的词表、输入输出空间和训练目标并不相同。MiniMax 的做法更像保留一套已经学会长程依赖和序列推理的“大脑”,随后替换它接收和输出音乐符号的接口,再通过联合训练让其理解声学码本。
**Qwen3-8B 是通义千问团队发布的 80 亿参数语言模型,也是 Music3 全局模块的初始化基础。**关于 Qwen3 本身的架构与模型信息,可以在其官方 GitHub 仓库中查阅;但 Music3 的实际音乐能力来自后续适配和音乐数据训练,不能直接用 Qwen3 的文本基准成绩推断。
**8B 与 0.6B 相加约为 8.6B,但这不应被直接当作 Music3 全部系统参数的最终口径。**公开信息只明确了两个主要语言模型模块的规模,没有完整列出音频编解码器、条件编码模块或其他组件,因此“8.6B”更准确的含义是两级 LLM 的名义参数总和。
32kHz WAV够用,但还不是录音棚母带标准
**Music3 输出的是 32kHz、16-bit、双声道 WAV 文件,定位更接近可继续编辑的生产素材,而不是只供在线播放的压缩音频。**WAV 通常保留未压缩 PCM 数据,方便创作者导入数字音频工作站进行剪辑、均衡、压缩和混音,也避免再次编辑 MP3、AAC 等有损格式造成额外劣化。
**一首满 5 分钟的 Music3 音频理论 PCM 数据量约为 38.4MB。**计算方式是 32000 次采样/秒 × 16 bit × 2 声道 × 300 秒,再除以 8 转换为字节;实际 WAV 文件还会包含少量文件头和元数据,但额外占用可以忽略不计。
**32kHz 采样率对应的理论最高可记录频率约为 16kHz。**这一规格高于许多语音产品,却低于常见 CD 音频的 44.1kHz,也低于专业制作中常见的 48kHz。对人声 Demo、短视频歌曲、播客主题曲和多数移动端播放场景来说已经够用,但如果目标是直接进入商业发行和专业母带流程,32kHz 仍会限制后期处理空间。
| 音频规格 | Music3 | CD 音频 | 常见影视制作规格 | |---|---:|---:|---:| | 采样率 | 32kHz | 44.1kHz | 48kHz | | 位深 | 16-bit | 16-bit | 常见 24-bit | | 声道 | 立体声 | 立体声 | 立体声或多声道 | | 5分钟未压缩体积 | 约 38.4MB | 约 52.9MB | 24-bit 立体声约 86.4MB |
**Music3 当前公开的是立体声混音结果,而不是可单独编辑的人声、鼓、贝斯和其他乐器分轨。**这一区别对专业用户很重要:完整 WAV 可以试听和整体处理,但如果模型把人声混响做重了,或者底鼓与贝斯发生冲突,没有 stems 分轨就很难精确修复。本次发布信息也没有披露 MIDI、工程文件或多轨导出能力。
“完整歌曲”比“可直接发行”少了好几步
**Music3 已经跨过了歌曲长度门槛,但 5 分钟上限不代表每次都能得到 5 分钟的高质量作品。**真正影响可用率的指标还包括提示词遵循度、歌词咬字、韵律匹配、重复生成稳定性、复杂语言发音、段落转场自然度,以及副歌在多次出现时是否既一致又有变化。
**官方所说的“完整歌曲”主要指时间与结构完整,而不是商业制作流程完整。**一首具备前奏、主歌、副歌和尾奏的歌,仍可能需要人工修改歌词重音、重新安排段落长度、修复人声伪影、调整响度,并完成混音和母带处理。Music3 更现实的定位,是把“词曲小样到完整 Demo”的时间压缩下来,而非一键替代作曲、编曲、演唱和后期制作的全部环节。
**Music3 最有价值的场景是需要快速验证创意、同时又不满足于几十秒片段的内容生产。**例如影视团队可以先生成带完整情绪曲线的临时配乐,游戏团队可以验证角色主题曲,音乐人可以测试不同风格下的歌词适配,短剧和品牌内容团队也能在同一主题下快速筛选多个版本。
**长达 5 分钟的生成能力还会改变 AI 音乐产品的交互方式。**过去用户经常需要生成多个片段,再通过续写、拼接和剪辑得到一首歌;一旦模型能在单次生成中管理完整结构,产品重点就会从“多生成几段”转向“精确控制哪一段”。下一阶段真正有竞争力的功能,很可能不是继续把时长推到 8 分钟或 10 分钟,而是允许用户只重做第二段主歌、保留副歌旋律、更换桥段配器,或者锁定主唱身份后批量制作歌曲。
它开始正面进入Suno和Udio的主战场
**Music3 已经进入以完整歌曲为核心的 AI 音乐竞争区间,而不再只是 MiniMax 语音能力的延伸。**Suno、Udio 等产品早已证明,普通用户真正愿意消费的不是底层声学指标,而是输入几句话后得到一首“像歌”的成品;Music3 的差异化技术答案,则是公开强调分层自回归架构和长程结构建模。
| 竞争维度 | MiniMax-Music3 本次披露情况 | 判断 | |---|---|---| | 单次歌曲长度 | 最长 5 分钟 | 已覆盖多数流行歌曲长度 | | 长程结构 | 明确覆盖主歌、副歌、桥段、间奏等 | 是本次发布的核心卖点 | | 人声与伴奏 | 可在同一歌曲内生成 | 达到完整歌曲产品基本门槛 | | 音频格式 | 32kHz、16-bit 立体声 WAV | 便于后期,但规格并非专业母带级 | | 分轨导出 | 本次未披露 | 专业编辑能力仍待确认 | | 局部重绘与段落编辑 | 本次未披露 | 决定生产工具价值的关键缺口 | | 生成速度与价格 | 本次未披露 | 暂时无法计算单位歌曲成本 | | 授权与训练数据说明 | 本次资料未完整披露 | 商用前仍需核对具体条款 |
**Music3 目前最大的未知数不是模型能否唱满 5 分钟,而是用户要生成多少次才能得到可用版本。**如果一首可用歌曲需要反复尝试十几次,时长优势会被生成成本和筛选时间抵消;如果模型可以稳定遵循歌词、曲风、速度、乐器和段落描述,那么它才会从展示型能力变成生产工具。
**价格、生成延迟和可控编辑能力尚未在本次资料中给出,因此现在还不能断言 Music3 已经超过现有头部产品。**对开发者和专业创作者而言,5 分钟只是入场券,批量任务稳定性、版权边界、音色一致性、局部修改、分轨输出和商业授权才是决定是否迁移工作流的指标。
MiniMax这次解决了AI音乐最显眼的短板
**MiniMax-Music3 的进步是把 AI 音乐从“片段生成”推向了“歌曲级生成”。**8B Global LLM 负责长程语义与结构,0.6B Local LLM 负责声学细节,这种清晰分工比单纯宣布时长翻倍更值得关注,因为它直接针对长音频最容易失控的部分。
**Music3 的实际质量仍需要独立试听和批量测试验证。**官方样例通常代表经过筛选的上限,不能等同于普通提示词下的平均表现;尤其需要观察 4 至 5 分钟区间是否出现主唱音色漂移、歌词遗漏、节奏失稳和编曲能量断裂。
**这次发布最明确的结论是,AI 音乐模型的竞争指标已经从“能不能生成一段歌”升级为“能不能完成一首歌”。**MiniMax 用 300 秒时长、分层自回归架构和明确的段落建模给出了自己的答案,但要真正进入专业生产环节,它接下来仍需补齐分轨、局部编辑、更高采样率、成本与授权透明度。
参考来源
- IT之家:MiniMax-Music3 音乐模型发布,AI 生成最长 5 分钟歌曲——包含发布日期、模型架构、参数规模、生成时长和输出规格等核心信息。
- Qwen3 官方 GitHub 仓库——用于核对 Music3 Global LLM 初始化基础 Qwen3-8B 的官方模型信息。



