我之所以开始做这个,是因为我一直很难找到准确、高质量、能用作 H3 参考的图像,于是我发现这个模型在角色一致性方面非常出色,而且最多可以接受 9 张参考图。
随便丢几张粗略的参考图进去,就能得到一张可以长期复用的角色设定图。
和你们中的很多人一样,我最近一直在折腾 H3,并对它的多图参考功能上了点瘾。你最多可以给它 9 张图片,这意味着你可以把零碎元素拼成一个角色——脸从这里拿,盔甲从那里拿,帽子从别处拿——而它真的能把这些保持在一起。
这个工作流做的就是这件事:让角色旋转 360 度(如果使用 4 面板版本则为 180 度),然后输出一张参考设定图,让你之后制作的一切都能保持角色一致。
如果你分别生成同一角色的六张图像,它们往往会互相“打架”。下巴会偏移,外套会变,颜色会漂移。你懂的。
而 一次 视频生成出的六帧画面就不会这样——它们来自同一次生成。这就是整个技巧所在。镜头缓慢环绕,没有硬切;角色像雕像一样保持静止;然后工作流抓取六帧画面,把它们拼成一张图。
你还可选择输出 360 度旋转视频和每一张单独的帧,作为可选输出,如果你自己想挑选角度,或之后将单帧作为参考。
| 文件 | 说明 |
|---|---|
H3_CharSheetMaker_6_Panel.json | 正面、两侧、背面,另加两张面部特写 |
H3_CharSheetMaker_4_Panel__Faster_.json | 四个视角,帧数减少约 40%,速度明显更快 |
同一位骑士,4 格:
模型 — 每个加载节点都内置了下载链接,因此打开工作流时,ComfyUI 应该会直接提示你下载缺少的文件。
| 槽位 | 文件 | 放入目录 |
|---|---|---|
| 扩散 | minimax_h3_ref2va_pruned_int8_convrot.safetensors | models/diffusion_models/ |
| 文本编码器 | qwen3vl_32b_minimax_h3_int8_convrot.safetensors | models/text_encoders/ |
| 视频 VAE | minimax_h3_video_vae_int8_convrot.safetensors | models/vae/ |
| 音频 VAE | minimax_h3_audio_vae_fp32.safetensors | models/vae/ |
| Turbo LoRA(可选) | minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensors | models/loras/ |
这些是 INT8 低显存版本。如果显存有余量,更高精度的版本能带来更丰富的细节——尤其是文本编码器,提示词遵循能力主要取决于它。
自定义节点 — 我尽量让工作流保持原生。唯一的第三方内容位于可选的 Speed Ups 组:
如果不需要,可以删除该组。
每张图写一行。说明要保留什么,以及——这一点比大多数人预期的更重要——说明要忽略什么:
<Picture 1> - keep the photo style. Use the bald head, facial hair, physique.
<Picture 2> - keep only the black outfit. Remove the hair, remove accessories.
<Picture 3> - use the shield. It is attached to the man's back.如果不按名称明确排除无关内容,背景和错误人物的头发就会混进来。
也值得用文字描述服装,而不仅仅是展示。脸部特征可以自然延续,但服装容易漂移。"黑色高领外套配银色扣环"这种描述更稳定;"第 2 张图里的那件外套"则会跑偏。
有人问它能否做动漫转真人写实,所以这里也提供了一个修改版 B prompt。它对此的效果出乎意料地好。
Haruhi:
Sanji:
下面是实际的源视频,方便你查看它是如何工作的——缓慢旋转,无剪辑,最后有几个面部镜头:
六个面板只是从该视频中抽出的帧。
该模型在物体生成上也表现出色,但建议提供更多角度的参考图。
它非常非常慢。 你需要生成 124 帧,才能使用其中的 6 帧。这就是该方案根本上的荒谬之处。4 面板版本会有帮助,它只生成 73 帧并取用 4 帧(提速 40%)。
提速会有代价。 Turbo LoRAs 和缓存确实能加快速度,但提示词遵循度和质量会略有下降。大多数情况下值得,最终轮除外。
质量有限。 这是视频模型,它更擅长视频而非静态图。如果在乎,可以调高分辨率和步数,但要用生成时间来买单。
单靠角色表可能不足以处理特写。 每个面板的分辨率就那样。对于近景工作,我会用角色表 配合 一些细节图——脸部、服装纹理、任何重要的内容。而且说实话,对于一次性视频,跳过角色表、直接使用原始素材可能更好。
这些工作流文件归我所有,你可以随意使用。
模型则不同。 MiniMax H3 采用社区许可,但排除了欧盟、英国、韩国和美国,并且该许可不仅适用于模型权重,也适用于输出。如果你打算用于任何商业用途,请亲自阅读 正式许可证,而不是听我的一面之词。我不是律师。
基于 Comfy-Org/MiniMax-H3 构建。如果你把它弄坏了或改进了它,欢迎留言。
作者:C_Nugget