HuggingFace镜像/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
模型介绍
文件和版本
分析

Qwen3-VL-32B Heretic(MiniMax-H3 文本编码器)—— NVFP4

无审查的 MiniMax-H3 文本编码器,大小仅 15.7 GB,可在单张 16 GB 显卡上运行。

这是对 ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot 进行的混合精度 NVFP4 重新量化版本,该版本是用于 MiniMax-H3 视频生成的 Heretic(无审查)文本编码器。

版本构建大小能否在 16 GB 显卡上运行?
Heretic INT8-ConvRot(上游版本)26.4 GB否(需要内存卸载)
Heretic NVFP4(本仓库)15.7 GB是
Comfy-Org NVFP4(有审查)15.7 GB是

与 Comfy-Org 官方 NVFP4 编码器大小相同,因此它是一个即插即用的替代品:只需将 CLIPLoader 指向此文件,您 MiniMax-H3 工作流的其余部分无需任何更改。

初衷

80 GB 显存的显卡用户一直有选择的余地。而本项目是为那些没有这类显卡的用户准备的。创意工作不应依赖数据中心级别的硬件——这正是对其进行量化的全部意义所在。

实测数据

使用 MiniMax-H3 fl2va 剪枝 INT8 扩散模型、res_multistep 20 步、ComfyUI 0.30.0 以及 Sage Attention 启用的情况下,生成了 6 秒的 480×864 竖屏带音频视频:

项目数值
GPU1× RTX PRO 2000 Blackwell(16 GB,sm_120)
生成过程中的峰值显存占用~9.9 GB
编码器加载到显存的大小14.9 GB(动态加载)
ComfyUI 进程使用的系统内存~36 GB

在相同的提示词和种子下,将输出结果与上游 INT8-ConvRot 版本进行了对比。两者在视觉上完全一致——量化处理不会改变编码器的描述内容。

文件

qwen3vl_32b_heretic_minimax_h3_nvfp4.safetensors   15.7 GB

将其放置在 ComfyUI/models/text_encoders/ 目录下,并在 CLIPLoader 中选择(类型:minimax)。 您仍需从 Comfy-Org/MiniMax-H3 获取扩散模型和 VAE。

它是如何制作的(以及您必须避免的陷阱)

上游权重已旋转。 其 comfy_quant 元数据显示:

{"format": "int8_tensorwise", "convrot": true, "convrot_groupsize": 256, "per_row": true}

ConvRot 会将每个权重预先与归一化的 Hadamard 矩阵相乘进行存储(按 256 宽度的分组执行 W_stored = W @ Hᵀ),并在运行时对激活值进行相应旋转以匹配。如果对这些权重进行反量化,然后直接重新量化为普通 NVFP4 格式而不撤销旋转操作,得到的文件虽然能够加载和运行,但会生成完全不相关的视频——在我们的首次尝试中,本应渲染战火纷飞街道的提示词,最终却生成了一艘在开阔水面上的快艇。整个过程不会出现任何错误,只是条件信息完全失去了意义。

由于 Hadamard 矩阵是正交的,修复方法是在重新量化之前再次乘以 H:

from comfy_kitchen.backends.eager.convrot_w4a4 import _build_hadamard

def unrotate(w, gs=256):                      # w: dequantized [out, in]
    out_f, in_f = w.shape
    h = _build_hadamard(gs, device=w.device, dtype=torch.float32).to(w.dtype)
    return torch.matmul(w.reshape(out_f, in_f // gs, gs), h).reshape(out_f, in_f)

混合精度。350 个线性层采用 NVFP4(TensorCoreNVFP4Layout,分组大小 16)。model.embed_tokens(151936 × 5120 = 77800 万参数)保留为 INT8——这与 Comfy-Org 在官方 NVFP4 构建中的选择一致。对其进行量化几乎不会带来尺寸收益,而且在烘焙过程中,正是这一层的临时数据会导致 16 GB 显卡出现内存不足(OOM)的情况。ComfyUI 会读取每层的 comfy_quant 元数据,因此混合精度文件无需特殊处理即可加载。

烘焙过程在单张 16 GB GPU 上运行,耗时约两分钟。

来源

  • 去审查化/Heretic 工作:ethanfel
  • 原始编码器:Qwen3-VL-32B(阿里巴巴/Qwen 团队),已适配 MiniMax-H3
  • MiniMax-H3:MiniMaxAI
  • ComfyUI 打包规范和量化布局:Comfy-Org
  • 本次 NVFP4 重新量化:Lna-Lab(@Tono_Ken3)

许可遵循上游仓库;MiniMax-H3 模型权重本身受 MiniMax H3 社区许可协议约束。

注意事项

  • 将 INT8 重新量化为 NVFP4 意味着此构建继承了上游 INT8 的舍入方式。直接从 BF16 进行烘焙的结果会略为清晰;但我们没有这些权重。
  • Blackwell(sm_120)用于烘焙和推理。NVFP4 需要硬件支持。
  • 如果输出结果与提示词无关,而非仅仅是质量下降,则可能是旋转不匹配问题,而非量化问题。