本仓库是社区编译的 MiniMax H3(海洛3.0) 量化与剪枝权重集合,针对 ComfyUI 等本地推理环境进行了优化。
通过将多种量化格式(INT4、INT8、混合精度及 NVFP4)整合到一个结构化仓库中,本 hub 让拥有消费级 GPU(16GB - 24GB 显存)的用户能够更轻松地体验 MiniMax H3 强大的全模态文本/图像/音频转视频生成能力。
如果您刚接触本地生成,不确定该下载什么文件,请根据您的显卡参考本指南。
⚠️ 关于 VAE 的注意事项: 无论您使用何种 GPU,所有人都必须下载
/vae文件夹中的两个文件(minimax_h3_audio_vae_fp32.safetensors和minimax_h3_video_vae_fp16.safetensors)。
适用于 RTX 4070 Ti Super、RTX 4080 等型号。
MiniMax_H3_[...]_pruned_int4_convrot.safetensors)或 混合精度 版本(_mixed_int4_int8_)。qwen3vl_32b_minimax_h3_int4_convrot.safetensors适用于 RTX 3090、RTX 4090 等型号。
MiniMax_H3_[...]_pruned_int8_convrot.safetensors)以获得最高的剪枝质量。qwen3vl_32b_minimax_h3_int8_convrot.safetensors专用于 RTX 5090、PRO 6000 及其他下一代 Blackwell 架构显卡。30/40 系列显卡请勿下载!
MiniMax_H3_[...]_pruned_nvfp4.safetensors)。qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors本仓库采用统一命名规范(MiniMax_H3_FL2VA_* 和 MiniMax_H3_Ref2VA_*),以便轻松集成到您的本地流水线中。
MiniMax_H3_FL2VA_pruned_mixed_int4_int8_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_mixed_int4_int8_convrot.safetensorsMiniMax_H3_FL2VA_pruned_int8_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_int8_convrot.safetensorsMiniMax_H3_FL2VA_pruned_int4_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_int4_convrot.safetensorsMiniMax_H3_Ref2VA_pruned_nvfp4.safetensors(12.5 GB)MiniMax_H3_Ref2VA_nvfp4_mixed.safetensors(24.4 GB)MiniMax_H3_FL2VA_pruned_nvfp4.safetensors(12.5 GB)/text_encoders)qwen3vl_32b_minimax_h3_int4_convrot.safetensors(15.0 GB)- 推荐用于 16GB GPUqwen3vl_32b_minimax_h3_int8_convrot.safetensors(27.1 GB)- 推荐用于 24GB GPUqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(15.7 GB)- 适用于 Blackwell GPU/vae)minimax_h3_audio_vae_fp32.safetensors(605 MB - 音频解码器)minimax_h3_video_vae_fp16.safetensors(5.21 GB - 视频解码器)MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能生成具有原生立体声音频的视频,分辨率最高可达 2K,时长最长可达 15 秒。得益于其面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,能够出色地执行复杂的多模态指令。
H3 支持以下输入输出规格:
| 类别 | 规格说明 |
|---|---|
| 输出时长 | 4–15 秒 |
| 输出宽高比 | 支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16 |
| 输出分辨率 | 支持多种分辨率尺寸。默认短边设为 768 像素。通过 H3-Regenerate-2K 可实现 2K 生成 |
| 输出帧率 | 24 FPS |
| 输出音频 | 32 kHz 立体声 |
| 支持对话语言 | 稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。 |
| 模型变体 | 输入模式 | 规格说明 |
|---|---|---|
| H3-Base-FL2VA | 首末帧模式 | 支持零张、一张或两张输入图像。 - 无图像输入:文本生成视频模式 - 一张图像输入:首帧生成视频或末帧生成视频 - 两张图像输入:首末帧生成视频 |
| H3-Base-Ref2VA | 全参考模式 | 支持多模态参考输入: - 图像: ≤ 9 张 - 视频: ≤ 3 段;每段时长须为 2–15 秒;总时长 ≤ 15 秒 - 音频: ≤ 3 段;音频必须伴随图像或视频输入,不能作为唯一输入;每段时长须为 2–15 秒;总时长 ≤ 15 秒 - 混合输入: 所有输入类型的文件总数上限为 12 |
H3-Context-IR 是一个托管式预处理与编排系统,专为自由形式的多模态输入设计。它负责解读文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成输出之间的关联。H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。
(t, h, w) 上的位置关系。MiniMax H3(及其量化衍生品)根据 MiniMax H3 社区许可协议 发布。
用户提交的文本、图像和视频以及增强型提示词,在使用官方 API 时会受到自动化内容审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。这些防护措施不影响被许可方在 MiniMax H3 社区许可协议下的义务,尤其是与合法使用和使用限制相关的义务。
原始创建者 / 联系方式