HuggingFace镜像/Minimax-H3-nvfp4-INT4-INT8-Convrot
模型介绍
文件和版本
分析

MiniMax H3 - 量化与剪枝模型集合(INT4 / INT8 / NVFP4)

本仓库是社区编译的 MiniMax H3(海洛3.0) 量化与剪枝权重集合,针对 ComfyUI 等本地推理环境进行了优化。

通过将多种量化格式(INT4、INT8、混合精度及 NVFP4)整合到一个结构化仓库中,本 hub 让拥有消费级 GPU(16GB - 24GB 显存)的用户能够更轻松地体验 MiniMax H3 强大的全模态文本/图像/音频转视频生成能力。


💻 硬件与 GPU 选择指南(应下载哪个文件?)

如果您刚接触本地生成,不确定该下载什么文件,请根据您的显卡参考本指南。

⚠️ 关于 VAE 的注意事项: 无论您使用何种 GPU,所有人都必须下载 /vae 文件夹中的两个文件(minimax_h3_audio_vae_fp32.safetensors 和 minimax_h3_video_vae_fp16.safetensors)。

1. 标准高端 GPU(16GB 显存)

适用于 RTX 4070 Ti Super、RTX 4080 等型号。

  • 扩散模型: 下载 INT4 版本(MiniMax_H3_[...]_pruned_int4_convrot.safetensors)或 混合精度 版本(_mixed_int4_int8_)。
  • 文本编码器: 下载 qwen3vl_32b_minimax_h3_int4_convrot.safetensors

2. 发烧级 GPU(24GB 显存)

适用于 RTX 3090、RTX 4090 等型号。

  • 扩散模型: 下载 INT8 版本(MiniMax_H3_[...]_pruned_int8_convrot.safetensors)以获得最高的剪枝质量。
  • 文本编码器: 下载 qwen3vl_32b_minimax_h3_int8_convrot.safetensors

3. 仅限 Nvidia Blackwell GPU

专用于 RTX 5090、PRO 6000 及其他下一代 Blackwell 架构显卡。30/40 系列显卡请勿下载!

  • 扩散模型: 下载 NVFP4 版本(MiniMax_H3_[...]_pruned_nvfp4.safetensors)。
  • 文本编码器: 下载 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

FL2VA 与 Ref2VA(有何区别?)

  • FL2VA: 如果您仅需进行标准文本转视频或简单图像转视频(使用一到两张起始/结束图像),请下载此版本。
  • Ref2VA: 如果您需要使用高级全参考功能(多张图像、视频片段或音频输入),请下载此版本。

📦 包含文件及格式

本仓库采用统一命名规范(MiniMax_H3_FL2VA_* 和 MiniMax_H3_Ref2VA_*),以便轻松集成到您的本地流水线中。

1. 扩散模型

  • 混合 INT4/INT8:混合精度模型。需 15GB 以上显存(约 15.5 GB)。
    • MiniMax_H3_FL2VA_pruned_mixed_int4_int8_convrot.safetensors
    • MiniMax_H3_Ref2VA_pruned_mixed_int4_int8_convrot.safetensors
  • INT8:最高质量的剪枝模型。需 24GB 以上显存(约 21 GB)。
    • MiniMax_H3_FL2VA_pruned_int8_convrot.safetensors
    • MiniMax_H3_Ref2VA_pruned_int8_convrot.safetensors
  • INT4:适用于标准消费级硬件的高压缩模型(约 11.3 GB)。
    • MiniMax_H3_FL2VA_pruned_int4_convrot.safetensors
    • MiniMax_H3_Ref2VA_pruned_int4_convrot.safetensors
  • NVFP4:实验性 Nvidia 4 位浮点模型(需 Blackwell 架构)。
    • MiniMax_H3_Ref2VA_pruned_nvfp4.safetensors(12.5 GB)
    • MiniMax_H3_Ref2VA_nvfp4_mixed.safetensors(24.4 GB)
    • MiniMax_H3_FL2VA_pruned_nvfp4.safetensors(12.5 GB)

2. 文本编码器(/text_encoders)

  • qwen3vl_32b_minimax_h3_int4_convrot.safetensors(15.0 GB)- 推荐用于 16GB GPU
  • qwen3vl_32b_minimax_h3_int8_convrot.safetensors(27.1 GB)- 推荐用于 24GB GPU
  • qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(15.7 GB)- 适用于 Blackwell GPU

3. VAE(/vae)

  • minimax_h3_audio_vae_fp32.safetensors(605 MB - 音频解码器)
  • minimax_h3_video_vae_fp16.safetensors(5.21 GB - 视频解码器)

原始 MiniMax H3 系统概述

MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能生成具有原生立体声音频的视频,分辨率最高可达 2K,时长最长可达 15 秒。得益于其面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,能够出色地执行复杂的多模态指令。

H3 支持以下输入输出规格:

类别规格说明
输出时长4–15 秒
输出宽高比支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16
输出分辨率支持多种分辨率尺寸。默认短边设为 768 像素。通过 H3-Regenerate-2K 可实现 2K 生成
输出帧率24 FPS
输出音频32 kHz 立体声
支持对话语言稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。

模型变体与输入规格

模型变体输入模式规格说明
H3-Base-FL2VA首末帧模式支持零张、一张或两张输入图像。

- 无图像输入:文本生成视频模式
- 一张图像输入:首帧生成视频或末帧生成视频
- 两张图像输入:首末帧生成视频
H3-Base-Ref2VA全参考模式支持多模态参考输入:

- 图像: ≤ 9 张
- 视频: ≤ 3 段;每段时长须为 2–15 秒;总时长 ≤ 15 秒
- 音频: ≤ 3 段;音频必须伴随图像或视频输入,不能作为唯一输入;每段时长须为 2–15 秒;总时长 ≤ 15 秒
- 混合输入: 所有输入类型的文件总数上限为 12

模型架构

H3-Context-IR

H3-Context-IR 是一个托管式预处理与编排系统,专为自由形式的多模态输入设计。它负责解读文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成输出之间的关联。H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。

H3-Base

  • H3-Base 通过相应的编码器或 VAE 对不同模态进行编码,并将编码后的表示组织成统一的打包多模态序列。
  • 具体而言,文本由 H3-Encoder 编码;视觉输入由 H3-Encoder 和 H3-VisualVAE 共同编码;音频则仅由 H3-AudioVAE 编码。
  • H3-Omni-Transformer 联合预测视频和音频潜变量,随后这些潜变量分别被解码为视频和立体音频。

H3-Encoder

  • H3-Encoder 采用 Qwen3-VL-32B 的完整预训练权重,并将其第 50 层的隐藏状态提供给 H3-Omni-Transformer。

H3-VAE

  • H3-VisualVAE 是一个时间因果视频自编码器,空间压缩因子为 16 倍,时间压缩因子为 4 倍,具有 24 个潜通道(f16t4d24)。
  • H3-AudioVAE 对左右音频通道使用相同的编码器和解码器,但独立处理每个通道。它将 32 kHz 音频压缩为时间速率为 40 Hz 的潜令牌序列。

H3-Omni-Transformer

  • H3-Omni-Transformer 是一个拥有 330 亿参数的密集型单流 Transformer。
  • 该模型采用三维多模态旋转位置编码(MM-RoPE)来表示时间维度和两个空间维度 (t, h, w) 上的位置关系。

许可与法律

MiniMax H3(及其量化衍生品)根据 MiniMax H3 社区许可协议 发布。

用户提交的文本、图像和视频以及增强型提示词,在使用官方 API 时会受到自动化内容审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。这些防护措施不影响被许可方在 MiniMax H3 社区许可协议下的义务,尤其是与合法使用和使用限制相关的义务。

原始创建者 / 联系方式

  • 全球 API:platform.minimax.io
  • 联系方式:model@minimax.io