无审查的 MiniMax-H3 文本编码器,大小仅 15.7 GB,可在单张 16 GB 显卡上运行。
这是对 ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot 进行的混合精度 NVFP4 重新量化版本,该版本是用于 MiniMax-H3 视频生成的 Heretic(无审查)文本编码器。
| 版本构建 | 大小 | 能否在 16 GB 显卡上运行? |
|---|---|---|
| Heretic INT8-ConvRot(上游版本) | 26.4 GB | 否(需要内存卸载) |
| Heretic NVFP4(本仓库) | 15.7 GB | 是 |
| Comfy-Org NVFP4(有审查) | 15.7 GB | 是 |
与 Comfy-Org 官方 NVFP4 编码器大小相同,因此它是一个即插即用的替代品:只需将 CLIPLoader 指向此文件,您 MiniMax-H3 工作流的其余部分无需任何更改。
80 GB 显存的显卡用户一直有选择的余地。而本项目是为那些没有这类显卡的用户准备的。创意工作不应依赖数据中心级别的硬件——这正是对其进行量化的全部意义所在。
使用 MiniMax-H3 fl2va 剪枝 INT8 扩散模型、res_multistep 20 步、ComfyUI 0.30.0 以及 Sage Attention 启用的情况下,生成了 6 秒的 480×864 竖屏带音频视频:
| 项目 | 数值 |
|---|---|
| GPU | 1× RTX PRO 2000 Blackwell(16 GB,sm_120) |
| 生成过程中的峰值显存占用 | ~9.9 GB |
| 编码器加载到显存的大小 | 14.9 GB(动态加载) |
| ComfyUI 进程使用的系统内存 | ~36 GB |
在相同的提示词和种子下,将输出结果与上游 INT8-ConvRot 版本进行了对比。两者在视觉上完全一致——量化处理不会改变编码器的描述内容。
qwen3vl_32b_heretic_minimax_h3_nvfp4.safetensors 15.7 GB将其放置在 ComfyUI/models/text_encoders/ 目录下,并在 CLIPLoader 中选择(类型:minimax)。
您仍需从 Comfy-Org/MiniMax-H3 获取扩散模型和 VAE。
上游权重已旋转。 其 comfy_quant 元数据显示:
{"format": "int8_tensorwise", "convrot": true, "convrot_groupsize": 256, "per_row": true}ConvRot 会将每个权重预先与归一化的 Hadamard 矩阵相乘进行存储(按 256 宽度的分组执行 W_stored = W @ Hᵀ),并在运行时对激活值进行相应旋转以匹配。如果对这些权重进行反量化,然后直接重新量化为普通 NVFP4 格式而不撤销旋转操作,得到的文件虽然能够加载和运行,但会生成完全不相关的视频——在我们的首次尝试中,本应渲染战火纷飞街道的提示词,最终却生成了一艘在开阔水面上的快艇。整个过程不会出现任何错误,只是条件信息完全失去了意义。
由于 Hadamard 矩阵是正交的,修复方法是在重新量化之前再次乘以 H:
from comfy_kitchen.backends.eager.convrot_w4a4 import _build_hadamard
def unrotate(w, gs=256): # w: dequantized [out, in]
out_f, in_f = w.shape
h = _build_hadamard(gs, device=w.device, dtype=torch.float32).to(w.dtype)
return torch.matmul(w.reshape(out_f, in_f // gs, gs), h).reshape(out_f, in_f)混合精度。350 个线性层采用 NVFP4(TensorCoreNVFP4Layout,分组大小 16)。model.embed_tokens(151936 × 5120 = 77800 万参数)保留为 INT8——这与 Comfy-Org 在官方 NVFP4 构建中的选择一致。对其进行量化几乎不会带来尺寸收益,而且在烘焙过程中,正是这一层的临时数据会导致 16 GB 显卡出现内存不足(OOM)的情况。ComfyUI 会读取每层的 comfy_quant 元数据,因此混合精度文件无需特殊处理即可加载。
烘焙过程在单张 16 GB GPU 上运行,耗时约两分钟。
许可遵循上游仓库;MiniMax-H3 模型权重本身受 MiniMax H3 社区许可协议约束。