本仓库包含两个基于llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic构建的ComfyUI safetensors文件。
MiniMax-H3接收语言层49之后的未归一化隐藏状态。因此,此检查点包含Qwen3-VL嵌入、语言层0–49以及完整的视觉塔。它有意省略了语言层50–63、最终语言归一化层和LM头。
qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors
d84547412144b7c50a6ec77437a889b869d3ace88da77ef1775d3d2a4901c192完整的上游BF16源文件仍可在源仓库中获取。此处不重复提供。BF16格式的MiniMax-H3包超过51 GB,对于32 GB的RTX 5090来说不实用;此INT8构建版本为推荐版本。
qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors
b5bb9bb8dc87cf11cbee241a2d95d6d42fe52cf695ed26c093ac321f31160b20该尾部不是独立的CLIP,不重复令牌嵌入或视觉塔。它由ComfyUI-MiniMax-H3-Guide节点临时加载,并重用连接的标准MiniMax-H3 CLIP中的0–49层。生成完成后,它会被卸载,原始条件CLIP保持不变。
将两个 safetensors 文件放置在以下路径:
ComfyUI/models/text_encoders/MiniMax-H3/在 CLIPLoader 中选择它,类型为 minimax(MiniMax-H3)。使用当前的 ComfyUI 检出版本及其固定的 comfy-kitchen 依赖项。
关于提示词增强:
CLIPLoader 加载 0–49 条件模型检查点,类型选择 minimax。clip_tail 下拉菜单中选择 50–63 尾部。enhanced_prompt 和返回的、未更改的 clip 发送到常规的 MiniMax-H3 引导节点。如果连接的 CLIP 已是完整的生成模型,则将 clip_tail 保留为 [none — connected CLIP is already complete]。此时,增强器将调用所连接 CLIP 的常规 generate() 路径,无需加载或要求此尾部。
这些是 ComfyUI 检查点,而非完整的 Transformers 生成仓库。
条件模型检查点和增强器通过了实际运行时测试:
14b05228cef127ce529bc0c08660770d4af3e9a8comfy-kitchen==0.2.26comfy-aimdo==0.4.112.8.0+cu128MiniMaxH3TEModel_(1, 12, 5120)minimax_token_tags:(12,)CLIPLoader 加载了具有恰好 50 个语言层且无最终归一化层或 LM 头的条件模型。(1, 4, 5120) 输出,带有 token 标签。本地 CUDA 12.8 PyTorch 构建使用了回退操作,因为此 comfy-kitchen 版本推荐使用 CUDA 13.0+ 以获得其优化内核。尽管如此,编码仍成功完成。建议使用带有推荐 PyTorch 构建的当前 ComfyUI 环境。
固定的上游来源:
repository: llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic
revision: c44b949b30d111666a5ed9851c5cd633ed39b070当时已下载该修订版本的所有上游 BF16 分片,并在打包前根据其 Hugging Face LFS SHA-256 值进行了验证。
源模型卡片显示,Heretic v1.2.0 ARA 编辑针对语言层 31–40 中的 attn.o_proj。所有这些经过编辑的层均位于 MiniMax-H3 保留的 0–49 范围内,因此本检查点中包含去审查编辑。源模型报告显示,拒绝率为 4/100,而原始模型为 99/100,KL 散度为 0.0421,PIQA 为 92.87%,MMLU 为 79.87%。
去审查处理可减少拒绝行为,但不保证所有拒绝或安全行为均被移除,且可能会影响模型质量。
MiniMax-H3 BF16 包是使用 silveroxides/convert_to_quant 1.3.1 版本转换的。成功构建采用了 AdamW AdaRound 优化和 Plateau 早停策略,而非简单舍入:
env PYTHONPATH=.deps python .deps/bin/ctq \
-i qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_bf16.safetensors \
-o qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors \
--int8 \
--scaling_mode row \
--convrot \
--convrot-group-size 256 \
--comfy_quant \
--save-quant-metadata \
--custom-layers '^model\.embed_tokens\.weight$' \
--custom-type int8 \
--custom-scaling-mode tensor \
--custom-simple \
--exclude-layers '^visual\.' \
--low-memory \
--device cuda \
--manual-seed 42 \
--num-iter 4000 \
--optimizer adamw \
--verbose NORMAL语言块矩阵采用了经过学习的 ConvRot。仅标记嵌入使用简单的张量级 INT8,因为 ComfyUI 嵌入查找需要该布局。视觉塔完全保留为 BF16 格式。
生成尾部从相同的固定源代码打包,并单独进行转换:
env PYTHONPATH=.deps .deps/bin/ctq \
-i qwen3vl_32b_minimax_h3_generation_tail_50_63_bf16.safetensors \
-o qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors \
--int8 \
--scaling_mode row \
--convrot \
--convrot-group-size 256 \
--comfy_quant \
--save-quant-metadata \
--low-memory \
--device cuda \
--manual-seed 42 \
--num-iter 4000 \
--optimizer adamw \
--verbose NORMAL \
--layer-config tools/qwen3vl32b_generation_tail_quant.json \
--fullmatch98 个 transformer 矩阵采用了经过训练的 AdamW ConvRot。LM 头使用简单的按行 ConvRot,这样增强器就能分小块计算其 151,936 个输出行,避免出现数 GB 的临时反量化峰值。
完成的文件通过了对每个张量、数据类型、形状、缩放因子、每层描述符以及全局量化元数据条目的结构验证。所有 551 个受保护的 BF16 张量都与打包的 BF16 源进行了逐字节比较,结果均未发生变化。
尾部也通过了精确的结构验证:保留的 57 个 BF16 张量(304,128 字节)与源文件完全一致;其 99 个 INT8 权重、缩放因子、描述符和全局量化元数据均与声明的布局匹配。将基础源拓扑(902 个张量)与尾部源拓扑(156 个张量)相结合,可重构完整模型的全部 1,058 个张量,且无键冲突。