HuggingFace镜像/H3_Character_Sheet_Generator
模型介绍
文件和版本
分析

H3 Character Sheet Generator

我之所以开始做这个,是因为我一直很难找到准确、高质量、能用作 H3 参考的图像,于是我发现这个模型在角色一致性方面非常出色,而且最多可以接受 9 张参考图。

随便丢几张粗略的参考图进去,就能得到一张可以长期复用的角色设定图。

Celtic Knight character sheet

和你们中的很多人一样,我最近一直在折腾 H3,并对它的多图参考功能上了点瘾。你最多可以给它 9 张图片,这意味着你可以把零碎元素拼成一个角色——脸从这里拿,盔甲从那里拿,帽子从别处拿——而它真的能把这些保持在一起。

这个工作流做的就是这件事:让角色旋转 360 度(如果使用 4 面板版本则为 180 度),然后输出一张参考设定图,让你之后制作的一切都能保持角色一致。

Celtic Knight inputs

为什么还要用视频模型来做这件事

如果你分别生成同一角色的六张图像,它们往往会互相“打架”。下巴会偏移,外套会变,颜色会漂移。你懂的。

而 一次 视频生成出的六帧画面就不会这样——它们来自同一次生成。这就是整个技巧所在。镜头缓慢环绕,没有硬切;角色像雕像一样保持静止;然后工作流抓取六帧画面,把它们拼成一张图。


工作原理

  1. 放入你的图片,并在 Input Text (A Prompt) 框中描述它们
  2. 再加上一个 B Prompt,用来处理旋转、姿势、灯光等
  3. 它会生成一段缓慢的 360 度环绕,没有硬切,因此角色保持一致
  4. 抓取 6/4 帧画面,并拼成设定图

你还可选择输出 360 度旋转视频和每一张单独的帧,作为可选输出,如果你自己想挑选角度,或之后将单帧作为参考。


两个版本

文件说明
H3_CharSheetMaker_6_Panel.json正面、两侧、背面,另加两张面部特写
H3_CharSheetMaker_4_Panel__Faster_.json四个视角,帧数减少约 40%,速度明显更快

同一位骑士,4 格:

凯尔特骑士 4 格

所需准备

模型 — 每个加载节点都内置了下载链接,因此打开工作流时,ComfyUI 应该会直接提示你下载缺少的文件。

槽位文件放入目录
扩散minimax_h3_ref2va_pruned_int8_convrot.safetensorsmodels/diffusion_models/
文本编码器qwen3vl_32b_minimax_h3_int8_convrot.safetensorsmodels/text_encoders/
视频 VAEminimax_h3_video_vae_int8_convrot.safetensorsmodels/vae/
音频 VAEminimax_h3_audio_vae_fp32.safetensorsmodels/vae/
Turbo LoRA(可选)minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensorsmodels/loras/

这些是 INT8 低显存版本。如果显存有余量,更高精度的版本能带来更丰富的细节——尤其是文本编码器,提示词遵循能力主要取决于它。

自定义节点 — 我尽量让工作流保持原生。唯一的第三方内容位于可选的 Speed Ups 组:

  • KJNodes
  • rgthree(仅用到 Toggle Panel)

如果不需要,可以删除该组。


编写 A Prompt

每张图写一行。说明要保留什么,以及——这一点比大多数人预期的更重要——说明要忽略什么:

<Picture 1> - keep the photo style. Use the bald head, facial hair, physique.
<Picture 2> - keep only the black outfit. Remove the hair, remove accessories.
<Picture 3> - use the shield. It is attached to the man's back.

如果不按名称明确排除无关内容,背景和错误人物的头发就会混进来。

也值得用文字描述服装,而不仅仅是展示。脸部特征可以自然延续,但服装容易漂移。"黑色高领外套配银色扣环"这种描述更稳定;"第 2 张图里的那件外套"则会跑偏。


动漫转真人

有人问它能否做动漫转真人写实,所以这里也提供了一个修改版 B prompt。它对此的效果出乎意料地好。

Haruhi:

Haruhi anime to real

Sanji:

Sanji anime to real

下面是实际的源视频,方便你查看它是如何工作的——缓慢旋转,无剪辑,最后有几个面部镜头:

六个面板只是从该视频中抽出的帧。


物体

该模型在物体生成上也表现出色,但建议提供更多角度的参考图。

random shield picture i found on google

注意事项(如实说明)

它非常非常慢。 你需要生成 124 帧,才能使用其中的 6 帧。这就是该方案根本上的荒谬之处。4 面板版本会有帮助,它只生成 73 帧并取用 4 帧(提速 40%)。

提速会有代价。 Turbo LoRAs 和缓存确实能加快速度,但提示词遵循度和质量会略有下降。大多数情况下值得,最终轮除外。

质量有限。 这是视频模型,它更擅长视频而非静态图。如果在乎,可以调高分辨率和步数,但要用生成时间来买单。

单靠角色表可能不足以处理特写。 每个面板的分辨率就那样。对于近景工作,我会用角色表 配合 一些细节图——脸部、服装纹理、任何重要的内容。而且说实话,对于一次性视频,跳过角色表、直接使用原始素材可能更好。


提示

  • 更多步数 = 如果你愿意等待,质量会略好
  • B prompt 中写的是 "neutral A pose" —— 如果你想指定某个特定姿势,删掉那部分即可
  • 请使用同一角色的多张不同视角照片。 输入的视角越多,最终的 360 效果越好
  • 也适用于物体和道具。 你会需要微调 B prompt,主要是把面部特写换成细节特写
  • 每次运行的帧时序会有变化。如果某个面板看起来不对劲,打开 "save all frames" 输出,找到一个更合适的帧号并填入子图。重新拼接有缓存,因此几乎即时完成

关于许可证

这些工作流文件归我所有,你可以随意使用。

模型则不同。 MiniMax H3 采用社区许可,但排除了欧盟、英国、韩国和美国,并且该许可不仅适用于模型权重,也适用于输出。如果你打算用于任何商业用途,请亲自阅读 正式许可证,而不是听我的一面之词。我不是律师。


基于 Comfy-Org/MiniMax-H3 构建。如果你把它弄坏了或改进了它,欢迎留言。

作者:C_Nugget