MiniMax H3 正式开源 - 开放通用智能

开源发布

2026 年 8 月 3 日,我们正式开源新一代通用视频模型 MiniMax H3

MiniMax H3 是一个通用型全模态生成系统。它能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3 在预训练阶段便已具备广泛的多模态上下文理解与生成能力,能够出色地遵循复杂的多模态指令。

MiniMax H3 系统概览

模型规格

输入输出规格

  • 输出时长: 4–15 秒
  • 输出宽高比: 支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16
  • 输出分辨率: 支持多种分辨率,默认较短边 768 像素。使用 H3-Regenerate-2K 可实现 2K 分辨率生成
  • 输出帧率: 24 FPS
  • 输出音频: 32 kHz 立体声
  • 支持语言: 稳定支持 11 种语言——阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语、西班牙语

模型版本

① H3-Base-FL2VA(首尾帧模式) 支持输入 0 张、1 张或 2 张图像:

  • 不输入图像:文生视频模式
  • 输入首帧:首帧生视频
  • 输入尾帧:尾帧生视频
  • 同时输入首尾帧:首尾帧生视频

② H3-Base-Ref2VA(全模态参考模式)

  • 图像: 最多 9 张
  • 视频: 最多 3 段,每段 2–15 秒,总时长不超过 15 秒
  • 音频: 最多 3 段,必须与图像/视频一同输入,每段 2–15 秒,总时长不超过 15 秒
  • 混合输入: 所有类型输入文件合计最多 12 个

完整 H3 系统架构

完整的 H3 系统由三个模块组成:

H3-Context-IR

随着输入日益复杂,我们构建了一套专门系统用于深入理解和提炼输入的多模态指令,并将其转换为 H3 更易理解、可直接用于生成的形式——Context Intermediate Representation(上下文中间表示)。

H3-Context-IR 对最终输出质量非常重要。因此我们强烈建议将 H3-Context-IR API 接入生成流程,或者参考提示词指南搭建自己的上下文处理系统。

其内部工作流包括指令解析、跨模态关联、时序理解和复杂逻辑推理,会将理解序列化为结构化表示,并在不偏离用户原始意图前提下补充缺失或描述不充分的语义细节。

H3-Context-IR 依赖多阶段工作流和多个托管模型与服务,因此不包含在本次开源发布中。我们提供了 API 和详细教程(视频提示词写作指南、全参考模式输出指南)帮助开发者构建自己的预处理系统。

H3-Base

根据 H3-Context-IR 输出生成音频和视频,输出 768p 分辨率结果。

H3-Base 架构

架构概览: H3-Base 使用不同模态各自对应的编码器或 VAE 进行编码,将编码后的表示组织成统一的 packed multimodal sequence,通过 RoPE 表达 token 之间的空间和时间关系,再输入 H3-Omni-Transformer。

具体而言:

  • 文本由 H3-Encoder 编码
  • 视觉输入同时由 H3-Encoder 和 H3-VisualVAE 编码
  • 音频仅由 H3-AudioVAE 编码

H3-Omni-Transformer 联合预测视频 latent 和音频 latent,随后分别解码为视频和立体声音频。

H3-Encoder: 使用 Qwen3-VL-32B 完整预训练权重,提供第 50 层 hidden states 给 H3-Omni-Transformer。tokenizer 中增加了若干 special tokens(如 )。

H3-VisualVAE: 时间因果结构视频自编码器,空间压缩 16 倍,时间压缩 4 倍,latent channel 24(记作 f16t4d24)。进入 Transformer 前视觉 latent 以 1×2×2 patch size 进一步 patchify,等效 32 倍空间下采样。完成 encoder 训练后还训练了基于 ViT 的 decoder 以降低解码成本并提升重建质量。

H3-AudioVAE: 使用同一套编码器/解码器分别独立处理左右声道再组合,支持立体声输入输出。每个声道将 32 kHz 音频压缩为 40 Hz latent token 序列。

H3-Omni-Transformer: 33B 参数 dense single-stream Transformer,其中约 13B 参数位于 AdaLN 相关分支(推理时 AdaLN 调制输出可预计算缓存,无需加载这部分参数)。attention 层和 FFN 层不包含 modality-specific 结构,模态相关参数仅存在于 input/output layer 和 AdaLN 分支。使用三维 MM-RoPE 表达 (t, h, w) 位置关系。训练最后阶段引入原生稀疏注意力(首个开源版本仅提供全注意力推理,稀疏注意力后续更新发布)。

H3-Regenerate-2K

将 768p 生成结果连同原始上下文一并送回 H3,以 2K 分辨率重新生成。不采用传统专用超分辨率模块,而是通过 in-context 方式用 H3 基础模型对自身低分辨率结果重新生成。

优势:

  • 最大程度复用 H3 基础模型已有生成能力
  • In-context 形式再次利用原始多模态上下文,还原传统超分只能"猜"的小文字和精细细节

该模块目前尚未开源,提供 API 可复现并验证官方完整生成结果。

模型版本与输入规格

推荐工作流

H3-Base 本地部署

MiniMax H3 以两个 task-specific checkpoints 形式发布(FL2VA 和 Ref2VA),每个均包含针对相应任务训练的 Omni Transformer Model、processor、tokenizer、text encoder、Visual VAE 和独立 Audio VAE。

发布的 checkpoint 均采用 CFG Distillation 的 Omni Transformer 权重,以 self-contained 的 Hugging Face 模型仓库发布。目前支持通过 SGLang、vLLM、diffusers 和 ComfyUI 部署。

提供三类可复现的 768p 音视频生成案例:

  • T2VA: 输入完整 H3-Context-IR Prompt,直接生成包含画面、环境音、音效与配乐的音视频
  • FL2VA: 以首帧/尾帧/首尾帧为 keyframe,生成后续音视频
  • Ref2VA: 联合使用参考图像/视频/音频,实现人物与场景保留、动作与嘴型编辑、音色参考、原始音频复用等复合任务

完整 2K 工作流

将本地部署的 H3-Base 与官方 H3-Context-IR、H3-Regenerate-2K API 组合使用,复现 2K 视频质量:

  • H3-Context-IR 理解与扩展多模态输入,生成完整 Prompt
  • 本地 H3-Base 生成 768p 音视频
  • H3-Regenerate-2K 以 768p 视频为 base_video,结合扩展 Prompt 与原始上下文,再生成 2K 视频

同样提供 T2VA、I2VA、Ref2VA 三类完整复现案例,以及 API 直接生成的 2K/768p 参考结果。

许可协议

MiniMax H3 基于 MiniMax H3 Community License 发布。

快速体验

  • H3-2K 直出 API:https://platform.minimaxi.com/docs/api-reference/video-generation-v2-create
  • H3-Context-IR API:https://platform.minimaxi.com/docs/api-reference/video-generation-v2-h3-context-ir
  • H3-Regenerate-2K API:https://platform.minimaxi.com/docs/api-reference/video-generation-v2-regeneration
  • MiniMax Hub:https://hub.minimaxi.com/
  • 海螺 AI:https://hailuoai.com/
  • Hugging Face:https://huggingface.co/MiniMaxAI/MiniMax-H3
  • 魔搭社区:https://modelscope.cn/models/MiniMax/MiniMax-H3

Intelligence with Everyone.

ESC

输入关键词开始搜索

支持搜索标题、内容、标签