到目前为止,此版本是基于MiniMax H3基础模型的一项实验。该实验将另外两个视频扩散模型(LTX 2.3和Wan 2.2)以及test3及后续版本中的一个图像扩散模型(Krea 2)的学习模式整合到H3的Transformer架构中。
这是一个统一的Transformer,具有特定模态的输入投影器(视频、音频、条件),这些投影器馈入一个52块的Transformer堆栈(用于文本条件的2块token_refiner,加上50个主块),并配有特定模态的输出头。整个Transformer堆栈使用相同的块架构,这使得注意力层和MLP层成为模型间特征迁移的架构上合适的目标——模态路由位于管道边缘,而非Transformer内部。
LTX处理首先应用于H3的前部块,随后Wan处理针对H3的中后部块。每次处理都直接修改注意力权重;第二次处理还在更广泛的块范围内修改了前馈层。这两次视频捐赠模型处理共同表明,完全不同的视频模型架构都能为H3贡献其独特的可识别特征。
然后,第三次处理引入了Krea 2——一个图像扩散模型而非视频模型。这是一个更具探索性的方向,因为图像模型学习单帧内的空间关系,而视频模型学习多帧间的时空关系。Krea的贡献范围被严格限定在其注意力结构中承载空间学习的部分:查询投影(编码要关注哪些视觉特征),以及在少数位置的配对键和值投影(编码这些特征如何关联)。前馈层也进行了部分迁移,但仅迁移了Krea的门控MLP的输入侧——输出投影被跳过,因为Krea的组合逻辑是为图像模型的输出路径训练的,与H3的视频处理不匹配。这种更窄的范围使Krea能够贡献更精细的视觉特征和细节处理,而不会破坏H3的时间连贯性。
MiniMax的架构文档指出,H3的注意力层和前馈层不包含特定模态的结构——模型中处理“这是音频、视频还是文本”的部分位于模型的其他位置。这意味着注意力和前馈权重是从其他训练模型迁移特征的架构上合适的位置,而不会干扰H3处理每种模态的方式。这同样适用于同域视频捐赠模型和跨域图像捐赠模型,尽管跨域迁移需要更仔细的范围界定,因为图像模型的学习模式并非每一部分都能在视频模型中找到合适的位置。
这些修改使用正交投影数学——新的权重模式主要沿着基础模型尚未使用的方向添加到H3中。这使得迁移的特征能够补充H3,而非覆盖它。对于跨域的Krea处理,这一点尤为重要:Krea的模式和H3的模式在权重空间中几乎垂直,这为正交投影提供了最大的操作空间,同时几乎完全保留了H3自身的方向。
结合对受影响块的仔细控制——特别是对于Krea,仔细控制哪些注意力头位置接受注入,以避免干扰与音频处理最相关的头槽——这保留了H3生成带音频的连贯视频的核心能力,同时将其美学和运动特征向捐赠模型转移。模型的实际块权重、安全功能和防护机制在架构意义上保持未修改——所有修改都是对现有权重的受控 additive 扰动,而非替换模型自身的结构。
在最终的beta1配置中,H3模型接收了来自其他捐赠模型的精准移植,目标是token_refiner块0和1——这两个块的文本优化堆栈在文本嵌入用于主块生成条件之前对Gemma文本嵌入进行处理。由于文本优化决定了主块接收到的文本条件,此处的更改会影响整个提示方向和输出结构。
H3模型的融合Q/K/V投影被分解为单独的q_proj、k_proj、v_proj张量——这是必要的,因为融合格式不允许按 band 进行精准修改,但需要将它们重新融合回qkv_proj格式以用于ComfyUI推理。
attn_q被赋予Krea,以将文本优化的“关注内容”方向转向Krea的学习模式,从而在token级别改变风格。
attn_k被隔离。这一点值得作为经验发现提出来,供任何在H3上进行训练或合并的人参考:attn_k似乎承载着模型放大行为的关键校准。即使是轻微的扰动也会降低音频质量,以及模型强化学习中其他精细训练的细节。由于H3没有显式的控制门(不像LTX使用to_gate_logits),它似乎依赖于精确调整的attn_k来调节注意力强度。在不知道这一点的情况下触及K的标准训练流程可能会在不知不觉中降低模型质量。隔离K需要分解qkv三元组,仅针对Q和V,并重新融合——beta1工具链支持这一点。
attn_v通过linear-mag模式移植赋予了LTX-2.3(Eros系列)。V承载了输出特征的很大一部分,因此这是LTX Eros内容流入H3文本优化的地方。
这些三元组被重新融合回qkv_proj格式,然后Wan 2.2的主块MLP fc1被移植到块0和1中作为补充贡献——Wan 2.2的维度与H3的token_refiner MLP内部维度几乎完美对齐(96%覆盖率),使其在结构上非常适合。
这些移植共同注入了一种显著但微妙的影响:它们带来了特定的运动细节,调整了文本到视频(t2v)的风格,并且不会像许多训练和合并方法那样移除基础模型的提示或行为能力。存在一些音频质量下降,但程度有限。鉴于H3的统一音视频注意力架构,对视频路径进行有意义的修改很难与音频影响分开——这种统一性在合并/移植层面确实难以规避。
标准的H3社区许可适用。由于此版本现在承载了来自LTX 2.3、Wan 2.2和Krea 2的迁移特征,这些源模型的社区许可也同样适用于各自贡献的特征部分。