MiniMax H3 - 打破任务和模态的边界,通用全模态生成模型

发布

2026 年 7 月 31 日,我们正式发布 MiniMax H3。这是一款通用的全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力,能够输出具备原生双声道的音视频,最高可支持 15s 2K 分辨率。

MiniMax H3

根据前期邀测反馈,MiniMax H3 具备商用级的多场景内容生成能力,在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,可实现精准、可控的多模态内容编辑与生成,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。

得益于 Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration 等多项技术,我们有能力提供行业内最优的性价比。默认提供 2K 分辨率,模型在 2K 分辨率下每秒价格不到主流模型的 1/3,768P 分辨率下是主流模型 720P 的 1/2。

长期以来,闭源模型一直占据视频生成领域主导地位,迭代速度和生态开放性落后于大语言模型等领域。为了推动开源社区发展、加速国产芯片适配(H3 设计初期就考虑了多款现有国产芯片的兼容性),以及方便有需要的用户定制自己的版本,我们计划在未来几天内,在符合相关法律法规的前提下开放模型权重。

H3 的模型特色

多模态上下文理解

真实创作需要融合不同模态的复杂信息,同时引入图片、声音、视频等多模态信息源。例如,一个镜头 prompt 可以描述为"参考视频 1 的希区柯克镜头运动,让图 2 中的人物唱歌,歌声参考音频 3"。通过语言描述清楚上下文和目标视频的关系,复杂的全模态理解工作 H3 会自己完成。

  • 输入:视频 1(希区柯克运镜参考)+ 图 2(人物参考)+ 音频 3(歌声参考)
  • 输出:H3 生成融合所有参考的完整音视频

2K 表现

原生双声道

H3 的应用案例

  • 电影片头
  • 游戏 UI
  • 动态海报
  • 广告电商

H3 的设计理念

打破任务的边界:从专用迈向通用

我们之前研发过两代模型:Hailuo 01 从 0 到 1 构建系统,Hailuo 02 专注于架构效率、数据质量和规模等核心组件的提升。

在 H3 的设计过程中,我们意识到过往生成模型在任务上的局限性:图片生成往往分为独立的 T2I/Editing/主体参考/动作参考/风格参考等专家模型,声音生成中的人声、音效、音乐多作为独立领域研究,视频生成更是分为文生视频、图生视频、首尾帧、主体参考、动作参考、音色参考、视频编辑等细分功能;图像、视频、音频之间也有着清晰边界。

这些任务/能力/模态的隔离限制了使用上的自由度,也从训练范式上限定了模型的泛化能力。因此,H3 构建过程的第一纲领,即是任务的统一和泛化

H3 的预训练范式

数据和任务:

  • 文生图
  • 文生视频
  • 带有联合的音频生成,所有音频输出都是原生双声道模式
  • 原生多镜头建模
  • 文生音频
  • 不区分人声、音效、音乐,统一联合建模
  • 广义的参考和编辑:图片到图片、图片到视频、音频到音频、音视频到音视频的参考和编辑

广义的参考和编辑在设计中是指:

  • 完全由真实自然数据构成,具备良好数据扩展性
  • 由自然语言表述参考和编辑关系,不局限于有限任务;语言(广义智力结构)是泛化的桥梁

架构选择: 尽可能简洁、通用、高效,一切为了任务泛化服务。

训练策略: 尽可能早融合各种类型的数据和任务,合适的配比是关键。

这些选择导向同一个目标:让 H3 在预训练阶段就具备广泛的多模态上下文理解和生成能力。

我们看到,创作者可以直接用自然语言描述任务,而不仅是输入简单的画面提示词。随着多模态理解、指令遵循和复杂任务执行能力持续提升,视频模型将能够理解更完整的创作意图,处理更复杂的内容需求,并逐步从"生成一段视频"走向真正参与内容生产的全过程。

H3 的核心技术

Contextual Omni Representation

在训练 H3 的工程中,最重要的一件事是增加 Caption 能力。多模态上下文的引入使得 Caption 的定义被进一步泛化——我们不止需要描述目标视频,还需要描述上下文和目标视频之间的关系,甚至上下文内元素之间的关系。需要联合描述视频和音频,多镜头下的音视频关联更加复杂。

这本质上是一种 Contextual Omni Representation。语言在其中起到了可泛化的连结和解释作用,并让"任务"以一种开放描述的形式得到统一,这是 H3 广泛指令理解能力的根源。

为达到上述目标,我们定制了专门的模型和全模态理解管线,大部分素材需要消耗 100K Token 的推理,最终得到平均约 4K 的 Token。

H3-VAE:架构效率大幅优化

H 系列模型一直在 tokenizer 技术上持续探索。H3 彻底革新了前代 tokenizer 技术,在重建和易学性上取得全面提升,使得 H3 在效率上取得有竞争力的效果。其高压缩率带来了 4 倍的序列长度收益,大幅降低训练和推理成本,这也是支持原生 2K 分辨率的关键技术。

H3-Omni Transformer:面向任务泛化的架构选择

基于"架构应服务于任务"的设计理念,通用和高效是唯二目标。我们抛弃了曾经带来显著架构优势的 Hailuo-02 架构,因为它在以任务泛化为核心的模型定义中会带来额外复杂性,而我们相信"任务泛化"是不可逆转的趋势,架构技巧应为模型定义让路。

在 H3 中,由于多模态上下文引入,序列长度方差大了 3 倍,理解与生成部分的计算 workload 开始显著异质化。我们采用了理解与生成异构的训练架构,精细调优不同 workload 下的硬件利用率,并联合考虑每样本异构计算与样本间负载均衡,端到端提升了近 30% 的训练吞吐。

In-context Regeneration

对于 H3 的 2K 分辨率输出,我们没有选择常规专用超分模块,而是用 H3 基模对自己的低分辨率结果进行 in-context 重新生成。

这样做带来两方面优势:

  • Regeneration 过程最大程度复用 H3 基模已具备的生成能力
  • In-context 形式可以再次利用原有多模态上下文信息进行高分辨率输出,超越传统超分方案靠"猜"无法还原的信息(如小文字和细节)

In-context Regeneration 也是任务泛化的体现。

后续会发布更详细的 H3 Tech Report。

Vision & What's Next

语言、图片、视频、音频是广泛存在的自然模态,紧密交织在一起,是人与世界交互的基本媒介。由它们构成的多模态上下文可以高效表达广泛信息,而信息的表达和传递本身就是一种生产力。

对于多模态理解和生成来说,我们可以把语言看作一套可泛化可 Scaling 的计算系统,因此我们认为多模态应该紧密关联语言。

H3 目前存在的局限性及后续提升方向:

  • 生成能力最重要的基础是多模态上下文理解能力,后续会推动 H 系列下一个版本与 M 系列模型能力融合
  • 模型规模限制使得部分能力完成度仍有提升空间,Scaling 是明确方向
  • 部分场景画面精细度仍需提升,持续追求更高分辨率和更精细画质

Intelligence with Everyone.

ESC

输入关键词开始搜索

支持搜索标题、内容、标签