MiniMax Music 3.0 - 新一代开放权重、生产级全能音乐模型

发布

2026 年 8 月 13 日,我们正式推出新一代音乐生成模型 MiniMax Music 3.0。只需提供一个创意想法和可选的歌词,模型即可在一次生成中完成作曲、编曲、演唱与制作,创作出一首完整的歌曲。

MiniMax Music 3.0

Music 3.0 专注于音乐创作中最难以被简单提示词概括的部分:真正理解创作者的表达意图,在最长 5 分钟的完整歌曲中持续贯彻这一意图,以清晰且富有真实质感的方式呈现乐器,并让生成的人声更像真实演唱,而不是机器合成。

为此,我们从音乐描述、语言模型到声音渲染重新设计了整条生成链路:用细粒度时序描述呈现情绪、配器与演唱的发展,以全局—局部协作的 Hybrid-LM 兼顾长程结构和声学细节,再通过多层 RVQ、Hidden States 融合与 Flow-Matching/Flow-VAE 提升最终声音的保真度。由此带来三项核心升级:更准确地理解创作意图、更完整且富于变化的编曲,以及更清晰、更自然的声音表现。

Music 3.0 技术路线

Music 3.0 由三个相互衔接的核心组件组成:Tokenizer、Hybrid-LM 与 Synthesis。它们分别解决音乐信息如何被表示、长程结构与局部细节如何被建模,以及声音如何被高保真还原。

Music 3.0 技术架构

多层 RVQ:分离核心结构与声学细节

八层 RVQ 将音乐信息分级表达:第一层聚焦核心语义和结构,后七层逐步补足声学残差。分阶段训练让第一层先建立稳定的信息骨架,再由完整码本共同学习精细声音。这一设计既为长序列预测提供更稳定的离散表示,也避免让单层 token 同时承担过多结构与音质信息。

第一层使用大小为 16,384 的码本,集中表示核心语义与结构;第 2–8 层分别使用大小为 1,024 的码本,逐层补充残余声学细节。

Hybrid-LM:全局结构与局部声学协同建模

  • 8B Global LLM:基于 Qwen3.5-8B 初始化,负责语义 token 的逐帧预测和全局上下文
  • 0.6B Local LLM:随机初始化,负责帧内声学 token 的深度轴预测

训练分为全局对齐和联合训练两个阶段:先建立 Global LLM 对音乐语义的预测能力,再对全局与局部模型进行全参数联合训练。通过分层协作,模型能够同时处理完整歌曲的结构稳定性和每一帧中的声学细节。

Hidden State Fusion:从离散预测走向连续声音渲染

传统方案通常将离散声学 token 直接送入解码器。Music 3.0 则融合 Global LLM 与 Local LLM 的连续 Hidden States,作为 2.4B Flow-Matching 模块的条件输入,随后由 123M Flow-VAE 完成音频解码。

完整链路:

LLM 融合特征 → Flow-Matching → VAE Hidden States → Flow-VAE Decoder → 最终音频

这一设计让语言模型负责的结构理解与声学模型负责的声音还原通过连续表征直接连接,在保持长程一致性的同时,进一步提升发音准确性、乐器连贯性以及细节保真度。

Synthesis 模块参数

  • Flow-Matching:2.4B 参数,将融合后的 LM 特征映射至 VAE 隐空间
  • Flow-VAE:123M 参数,继承 MiniMax Speech 架构,针对音乐动态范围和频谱分布重新训练

理解创作意图

AI 生成的音乐可能听起来像一首完整的歌,却依然会偏离最初的创作要求:指定的乐器可能逐渐消失在编曲中,预设的情绪可能随着歌曲发展而减弱,人声风格也可能只在某个段落得到体现,却无法贯穿整首作品。

Music 3.0 升级了音乐描述方式:不再只用一个覆盖全曲的全局标签概括作品,而是通过 Structured Caption 对音乐进行细粒度的时序描述。它既描述曲风、BPM、拍号、调性、应用场景和制作质感,也刻画情绪如何起伏、主辅乐器何时进入或退出、律动与低频如何发展,以及演唱方式、和声和人声效果如何随段落变化。

这些描述把抽象的听感转化为可被模型学习和执行的专业编曲框架,使模型能够更准确地将创作语言转化为具体的音乐表达,并在歌曲发展过程中维持一致的音乐身份,同时保留必要的动态变化。

为降低专业创作门槛,我们还构建了基于模板的 Prompt Enhancement System。它从专业 Structured Caption 模板库中选择合适表达,参考音乐术语与编曲规则,将用户一句简单描述扩展成音乐逻辑完整、细节丰富的结构化指令。因此即使不掌握专业术语,创作者也能更精确控制结果——无论是一场亲密克制的不插电演出,一首由滚动踩镲与深沉 808 低音驱动的午夜 R&B,还是一段从内敛逐步发展至宏大规模的影视纯音乐。

更完整、更富于变化的编曲

长歌曲生成的难点不只是"生成得更久",而是让段落之间存在合理的发展:情绪需要铺陈和释放,乐器需要适时进入、叠加与退场,主歌、副歌、桥段和间奏也需要服务于同一个整体方向。

Music 3.0 通过两个层面解决这一问题:

  • 歌词段落标签: 歌词中的 [intro][verse][pre-chorus][chorus][bridge][instrumental][solo][outro] 等标签为歌曲提供宏观结构
  • Structured Caption: 进一步描述各时间阶段的情绪发展、配器变化、人声演绎、律动基础、装饰音色与空间效果,让"哪里发生什么变化"成为明确的生成条件

在模型侧,Hybrid-LM 的分工让模型既能维持最长 5 分钟歌曲的时间稳定性,也能在局部段落中保留丰富变化。

革新声音品质

令人信服的作曲,也需要令人信服的声音。Music 3.0 在音质方面实现显著提升,让混音更加开阔、清晰和平衡,减少拥挤和浑浊感。

推理时,Synthesis 模块不需要加载离散 Tokenizer 的解码结构,而是融合 8B Global LLM 与 0.6B Local LLM 最后若干层的连续 Hidden States,再通过 Flow-Matching 和 Flow-VAE 直接生成音频。相比只使用离散 token,连续特征保留了更丰富的高维声学信息,有助于提高人声发音准确性与乐器声音的物理连贯性。

这些提升覆盖了音乐表达的各个层面:独奏乐器的触弦与运弓,鼓组和贝斯的冲击力,密集电子编曲中的声部分离度,以及人声周围的空间感。Music 3.0 让这些元素进一步接近完整录音作品的聆听体验。

重塑自然人声

人声往往是生成音乐最容易暴露机器感的部分。高频伪影、僵硬的乐句、不清晰的发音和不自然的换气,即使出现在一首整体完成度较高的歌曲中,也会打断听众与作品之间的情感连接。

Music 3.0 引入全新声音渲染系统,旨在带来更加自然、更接近录音室品质的演唱表现:

  • Structured Caption 对音色、唱法、气声与假声等技巧、和声编排以及 Delay、Autotune 等人声效果进行细致描述
  • 融合自全局与局部语言模型的连续 Hidden States,将演唱信息带入 Flow-Matching 与 Flow-VAE 的音频生成过程

两者结合,减少了生成式人声中常见的高频"数字噪声",同时提升了对旋律、发音、呼吸和多层和声的控制能力。

人声能够更加连贯地响应歌曲在情绪和节奏上的变化:从克制的主歌走向开阔的副歌,从精确的节奏型演唱过渡到持续舒展的旋律线。和声可以更自然地围绕主唱展开,呼吸也成为演唱表达的一部分,而不是附着在人声周围的合成痕迹。

从创作意图到歌曲结构,从局部声学细节到最终声音呈现,Music 3.0 让音乐生成从"生成一段合理的音频",进一步迈向"实现一套完整、连贯的创作构想"。

ESC

输入关键词开始搜索

支持搜索标题、内容、标签