MiniMax-AI/MiniMax-H3
模型介绍
文件和版本
Pull Requests
讨论
分析
MiniMax

Hailuo AI API MiniMax Website GitHub Hugging Face
ModelScope MiniMax AI WeChat Discord LICENSE

MiniMax H3

最新动态

官方提示词写作优化技能:GitHub 技能库

在线 API

可直接通过 API 使用 MiniMax-H3。

  • 全球:platform.minimax.io | 中国:platform.minimaxi.com

在线应用

直接通过应用使用 MiniMax-H3。

  • 网页应用国际版:hailuoai.video | 中国版:hailuoai.com
  • 桌面应用国际版:hub.minimax.io | 中国版:hub.minimaxi.com

系统概述

MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能生成分辨率高达 2K、时长可达 15 秒的带原生立体声音频的视频。得益于面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解与生成能力,能够出色地执行复杂的多模态指令。

H3 支持以下输入输出规格:

类别规格
输出时长4–15 秒
输出宽高比支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16
输出分辨率支持多种分辨率尺寸。默认短边为 768 像素。通过 H3-Regenerate-2K 可实现 2K 分辨率生成
输出帧率24 FPS
输出音频32 kHz 立体声
支持对话语言稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。对其他语言也有不同程度的支持

模型变体与输入规格

模型变体输入模式规格
H3-Base-FL2VA首尾帧模式支持输入 0 张、1 张或 2 张图像。

- 无图像输入:文本生成视频模式
- 单图像输入:首帧生成视频或尾帧生成视频
- 双图像输入:首尾帧生成视频
H3-Base-Ref2VA全参考模式支持多模态参考输入:

- 图像: ≤ 9 张
- 视频: ≤ 3 段;每段时长 2–15 秒;总时长 ≤ 15 秒
- 音频: ≤ 3 段;每段时长 2–15 秒;总时长 ≤ 15 秒
- 混合输入: 所有输入类型的文件总数不超过 12 个

Image

完整的 H3 系统由以下三个模块组成:

  • H3-Context-IR:随着输入日益复杂,我们构建了专门的系统来深度理解和优化输入的多模态指令,然后将其转换为 H3 易于理解的形式——上下文中间表示,用于生成。H3-Context-IR 对最终输出质量至关重要,因此我们强烈建议将其整合到您的生成流程中,或遵循“提示词指南”构建您自己的上下文处理系统。
  • H3-Base:基于 H3-Context-IR 的输出生成音频和视频,产生 768p 分辨率的结果。
  • H3-Regenerate-2K:将 768p 结果与原始上下文一起重新输入 H3,以生成 2K 分辨率的输出。此过程利用了 H3 强大的生成能力和原始上下文中包含的丰富信息,能够生成细节更准确、视觉保真度更高的高分辨率输出。

模型架构

H3-Context-IR

H3-Context-IR 是一个托管式预处理与编排系统,专为自由形式的多模态输入设计。

它负责解读文本、图像、音频和参考视频之间的关联,以及这些素材与预期生成输出的关系。其内部工作流程包括指令解析、跨模态关联、时序理解和复杂逻辑推理。

H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。在不偏离用户原始意图的前提下,它还会在适当情况下补充缺失或表述不充分的语义细节。

由于 H3-Context-IR 依赖多阶段工作流程以及多个托管模型和服务,因此它未包含在本次开源发布中。我们提供了一个 API,使用户能够复现官方工作流程的行为。我们还提供了详细的教程,开发者可以按照提示指南(Prompting Guidance) 构建自己的预处理系统。

有关详细使用说明,请参见推荐工作流程 — 完整 2K 工作流程。

安全防护机制

用户提交的文本、图像、视频以及增强后的提示词均需经过自动化内容审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。我们采用行业标准的过滤措施,但无法完全消除误判(包括误报和漏报)。这些防护机制不影响被许可方在 MiniMax H3 社区许可证下的义务,特别是与合法使用和使用限制相关的义务。

H3-Base

Image

架构概述

  • H3-Base 通过其对应的编码器或变分自编码器(VAE)对不同模态进行编码,并将编码后的表示组织成一个统一的打包多模态序列。在将整个序列传递给 H3-Omni-Transformer 之前,使用旋转位置编码(RoPE)来捕获 token 之间必要的空间和时间关系。

  • 具体而言,文本由 H3-Encoder 进行编码;视觉输入由 H3-Encoder 和 H3-VisualVAE 共同编码;音频则仅由 H3-AudioVAE 进行编码。

  • H3-Omni-Transformer 联合预测视频和音频 latent,然后分别解码为视频和立体声音频。

  • 为降低长多模态序列的计算成本,H3 原生支持稀疏注意力(sparse-attention)训练和推理。初始开源版本仅提供全注意力(full attention)推理。我们的稀疏注意力实现将在未来更新中发布。

H3-Encoder

  • H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并将其第 50 层的隐藏状态提供给 H3-Omni-Transformer。

  • 我们在分词器配置中添加了若干特殊 token,例如 <d>。使用 H3 时,必须使用 H3 仓库中提供的分词器及相关配置文件。

H3-VAE

H3 使用分离的视觉和音频 latent 来表示其各自的模态。

H3-VisualVAE
  • H3-VisualVAE 是一个时间因果视频自编码器,其空间压缩因子为 16 倍,时间压缩因子为 4 倍,具有 24 个 latent 通道,表示为 f16t4d24。我们应用了多种 latent 空间优化技术,以共同提升重建质量和 latent 的可学习性。

  • 在传递给 H3-Omni-Transformer 之前,视觉 latent 会进一步按照 (时间, 高度, 宽度) 维度以 1 × 2 × 2 的 patch 大小进行分块。因此,进入 Transformer 的视觉 token 具有 32 倍的有效空间下采样因子,而时间下采样因子保持 4 倍。

  • H3-VisualVAE 的 latent 空间同时针对重建质量和生成模型的学习 ease 进行了优化。在训练其编码器之后,我们额外训练了一个基于 ViT 的解码器,以降低解码成本并进一步提升重建质量。

H3-AudioVAE
  • H3-AudioVAE 对左右音频通道使用相同的编码器和解码器,但对每个通道进行独立处理。解码后的通道随后重新组合,实现立体声音频的输入和输出。
  • 对于每个通道,H3-AudioVAE 将 32 kHz 音频压缩为时间速率为 40 Hz 的 latent token 序列。
  • 受 VA-VAE 的启发,我们优化了 latent 空间,以在保持音频重建质量的同时,使其更易于生成模型学习。

H3-Omni-Transformer

  • 为实现可扩展性和泛化能力,我们采用了相对简单的 Transformer 块设计。H3-Omni-Transformer 是一个具有 330 亿参数的密集型单流 Transformer,其中约 130 亿参数位于 AdaLN 相关分支。由于 AdaLN 调制输出可以预先计算并缓存,这些参数在仅推理部署时无需加载。我们发布完整的模型权重以支持进一步的开发,包括微调。

  • 注意力层和前馈网络(FFN)层均不包含模态特定结构。模态特定参数仅限于输入/输出层和 AdaLN 分支。特别是,模态特定的 AdaLN 能够以相对较低的额外训练和推理成本提升生成质量。

  • 该模型使用三维多模态旋转位置嵌入(MM-RoPE)来表示跨时间和两个空间维度 (t, h, w) 的位置关系。

  • 在训练的最后阶段,我们引入了原生稀疏注意力,以降低长序列的计算成本。稀疏注意力的实现未包含在初始开源版本中,将在未来更新中单独发布。

H3-Regenerate-2K

  • 针对 H3 的 2K 分辨率输出,我们并未采用传统的专用超分辨率模块,而是让 H3 基础模型通过上下文学习的方式对自身生成的低分辨率结果进行再生。

  • 这种方法具有两大优势:(1)再生过程能够最大程度复用 H3 基础模型的生成能力;(2)上下文学习的形式在生成高分辨率输出时可以复用原始的多模态上下文,从而能够恢复传统超分辨率方法不得不“猜测”的信息,例如小文本和精细细节。

  • 上下文再生也是任务泛化的一个实例。

  • 由于系统复杂性,该模块暂未开源。我们将在准备就绪后发布。 我们提供了用于验证官方结果的 API,详见下文的“完整 2K 工作流”。

推荐工作流

为帮助社区正确部署 MiniMax H3,我们提供两种验证方法。

完整的 H3 系统由 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块组成,因此“完整 2K 工作流”结合开放平台 API 与本地部署的 H3-Base,提供了 2K 输出的端到端验证管道。“H3-Base 本地部署”部分则提供了仅使用本地部署的 H3-Base 来验证 768p 输出的方法。

此外,“提示词指南”部分提供了详细教程,以帮助社区开发自己的提示词系统。

H3-Base 本地部署

MiniMax H3 以两个特定任务的检查点形式发布。每个检查点包含一个专用的 Omni Transformer 模型,以及所需的处理器、分词器、文本编码器、视觉 VAE 和独立的音频 VAE 组件。

检查点支持任务输入条件输出精度
MiniMax-H3 Base FL2VA文本到音视频(t2va)、首/末帧到音视频(fl2va)文本;可选首帧、末帧或两者皆有视频和音频BF16
MiniMax-H3 Base Ref2VA参考到音视频(ref2va)包含参考图像、视频和/或音频的文本视频和音频BF16

发布的检查点是经过 CFG 蒸馏的 Omni Transformer 模型权重。

每个检查点均以独立的 Hugging Face 风格仓库形式分发,包含以下组件:

<TASK>/
├── model_index.json
├── processor/
├── tokenizer/
├── text_encoder/
├── transformer/
├── visual_vae/
└── audio_vae/

下载模型。该仓库同时托管原始检查点(FL2VA/、Ref2VA/)和 diffusers 格式,因此请根据您的框架需求确定下载范围:

model_index.json 是仓库级别的公共入口。特定任务族的 diffusers 索引仍位于 FL2VA/model_index.json 和 Ref2VA/model_index.json 下。

# Original checkpoint, both task families (SGLang, vLLM):
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3

# Or a single task family:
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/*" --local-dir MiniMax-H3

diffusers 用户无需手动下载:ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 会准确获取所需的组件。有关加载方法,请参阅 diffusers 文档。

我们推荐使用以下推理框架来部署模型:

  • SGLang - 详见 使用指南

  • vLLM - 详见 vllm 使用方法

  • diffusers - 详见 diffusers 文档

  • ComfyUI - 详见 Comfy 教程;使用 R2V 模板 / T2V 模板

Sglang 部署

此处以 sglang 为例进行部署说明。有关其他部署配置,请参见 MiniMax-H3 部署指南。

FL2VA:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30010 \
  --model-variant fl2va

Ref2VA:

sglang serve \
  --model-path MiniMaxAI/MiniMax-H3 \
  --num-gpus 4 \
  --ulysses-degree 4 \
  --performance-mode speed \
  --host 0.0.0.0 \
  --port 30011 \
  --model-variant ref2va

可复现的 768p 案例

以下三个用例 T2VA、FL2VA 和 Ref2VA 展示了如何复现 MiniMax-H3 的视频-音频生成过程。

用例请求结果
T2VA查看脚本t2va.mp4
FL2VA查看脚本fl2va.mp4
Ref2VA查看脚本ref2va.mp4

完整 2K 工作流

本节介绍如何将本地部署的 SGLang 服务与官方的 H3-Context-IR 和 H3-Regenerate-2K API 相结合,以复现 MiniMax API 直接生成的 2K 视频质量。 开始之前,请配置 SGLang 端点和您的 MiniMax API 凭证:

# URL of your SGLang deployment
SGLANG_DEPLOYMENT_URL="<sglang-deployment-url>"

# MiniMax API endpoint (choose one)
# CN
MINIMAX_API_BASE="https://api.minimaxi.com"
# Global
# MINIMAX_API_BASE="https://api.minimax.io"

# API token obtained from the MiniMax platform
TOKEN="<token>"

MiniMax 平台:

API 文档:

  • 创建 H3-2K:使用 /video-generation-v2-create 英文文档,中文文档
  • H3-Context-IR:使用 /video-generation-v2-h3-context-ir 英文文档,中文文档
  • H3-Regenerate-2K:使用 /video-generation-v2-regeneration 英文文档,中文文档

以下示例将本地 H3-Base 输出文件编码为 Base64 数据 URL。对于生产环境使用,建议将视频上传至可公开访问的 URL,并将该 URL 作为 base_video 参数传入。

对于以下每个案例,我们均提供了通过开放平台 API 直接生成的 2K 和 768p 参考输出,以便更轻松地验证结果。

case-T2VA

  • 类型:文本转视频
  • 时长:10 秒
  • 宽高比:16:9
阶段请求结果
H3-Context-IR查看脚本
{
  "task": {
    "id": "<task_id>",
    "model": "MiniMax-H3",
    "status": "succeeded",
    "created_at": "<created_at>",
    "updated_at": "<updated_at>",
    "content": {
      "prompt": "integrated_multimodal_description: [镜头 1] 电影感,中远景,缓慢推进。在星舰巨大、光线昏暗的舰桥内,光滑的金属控制台带有发光的琥珀色显示屏,两侧是巨大的弧形观察窗。一位40多岁、身材健硕、黑色短发中夹杂着银色发丝的女舰长站在画面中央的中景位置。她身着结构感十足、高领的深蓝色 military 束腰外衣,胸前佩戴着银色徽章。她背对着镜头,在透过厚玻璃涌入的冰冷环境星光下形成剪影。她双手紧握在身后,一动不动地站立着。窗外,庞大的灰黑色无畏舰舰队呈紧密编队悬浮在深紫色的太空星云背景中。舰队巨大的尾部推进器开始发出强烈且不断增强的明亮蓝光。[镜头 2] 在 00:04.500 处,镜头切换至舰长脸部特写并剧烈摇晃。舰队聚集能量产生的明亮蓝白色光芒在她深色的眼眸中生动地反射。突然,一道耀眼的白色闪光从窗口涌入,完全淹没了背景,舰队跃迁至超空间。巨大的空间力量猛烈震动舰桥,导致镜头 1 中的舰长略微向前踉跄,她绷紧肩膀,明显在抵抗物理震动。当强烈的白光突然消退,只留下紫色星云昏暗空旷的景象映照在她被强光照射的皮肤上时,她咬紧牙关,在这刚变得空旷的太空中缓缓闭上了眼睛。\noverall_soundscape: 飞船环境生命支持系统的低沉共振嗡鸣作为基线,很快被窗外舰队为超光速引擎充能时发出的可听见的、不断升级的高音电子嗡鸣声所淹没。在耀眼闪光期间,爆发出巨大、震耳欲聋的重低音轰鸣和尖锐的噼啪声,伴随着舰桥舱壁在巨大物理压力下发出的响亮金属嘎吱声、咔嗒声和深沉撞击声。强烈的轰鸣声随后突然中断,回到空洞、回荡的室内基调,只留下孤立舰桥微弱而稳定的嗡鸣。\nnon_diegetic_music: 电影化的太空歌剧管弦乐配乐,慢节奏,以孤独、哀伤的法国号旋律为主,伴随着深沉、持续的弦乐不和谐音,音量和强度迅速增强,在跃迁后达到巨大的管弦乐高潮,然后立即陷入寂静。"
    },
    "duration": 10,
    "usage": {
      "total_tokens": 8565,
      "prompt_tokens": 5650,
      "completion_tokens": 2915
    },
    "ratio": "16:9",
    "task_type": "h3_context_ir",
    "modality": "text"
  }
}
H3-Base查看脚本t2va.mp4
H3-Regenerate-2K查看脚本t2va_2k.mp4
通过直接调用开放平台 API 获得的 2K 参考结果查看脚本h3_direct_2k.mp4
通过直接调用开放平台 API 获得的 768P 参考结果查看脚本h3_direct_768p.mp4

case-I2VA

  • 类型:首帧图像转视频
  • 时长:8 秒
  • 宽高比:自适应
阶段请求结果
H3-Context-IR查看脚本
{
  "task": {
    "id": "<task_id>",
    "model": "MiniMax-H3",
    "status": "succeeded",
    "created_at": "<created_at>",
    "updated_at": "<updated_at>",
    "content": {
      "prompt": "对于目标视频,在目标视频的 0.00 秒处,完全参考<图片 1>(来自[镜头 1])。\n\nintegrated_multimodal_description: [镜头 1] 这是一个真人实拍、具有浅景深的电影化镜头。在整个八秒的时长内,镜头保持完全静态,捕捉传统日式餐厅内温馨的家庭聚会场景。画面一开始,前景是一个巨大、图案复杂的蓝白陶瓷拉面碗,对焦清晰锐利。碗放置在一张光滑、抛光的长木桌上。碗内,浓郁油亮的金棕色汤底环绕着黄色的波浪形面条,顶部放着两片厚实圆润的叉烧肉,肉上可见脂肪纹理和明显的螺旋肉纹。中央是一大团新鲜切碎的亮绿色葱花,右侧边缘则卷着一片脆爽的深绿色海苔。碗的左侧,一双浅棕色的木筷横放在一个黑色的小长方形状的筷架上,旁边是一个带有蓝色彩绘图案的圆柱形小陶瓷茶杯。桌子右侧,一个带有竹骨框架的球形纸灯笼放在黑色的木制底座上。背景中,七口之家围坐在桌旁,最初呈现为柔和的模糊景象。他们身后,带有木格框架的传统日式推拉障子门敞开着,露出外面阳光明媚、绿树成荫的景象。视频开始后不久,热拉面碗冒出的浓密白色蒸汽立即加剧,在碗上方形成厚厚的、旋转的云雾,不断舞动。随着视频进入中间时段,镜头保持静态,而焦点开始有目的地、平滑地向房间深处转移。前景的拉面碗、其鲜艳的食材以及上升的蒸汽逐渐变得柔和,成为朦胧的失焦模糊。同时,背景中的家庭成员变得清晰锐利、细节分明。前景持续上升的浓重蒸汽在镜头和家庭成员之间形成了一道动态的半透明帷幕。现在焦点牢牢锁定在背景上,充满活力的家庭晚餐场景变得生动起来。左边穿着深蓝色长袖衬衫的男子身体前倾,嘴巴生动地动着,进行无声的交流。旁边穿着 crisp 白色短袖 T 恤的小女孩灿烂地笑着,看向桌子中央。最左边穿着柔和浅蓝色长袖上衣的女子微微转过头,温柔地微笑着。桌子对面,穿着浅灰色纽扣衬衫的女子笑容灿烂,眼睛眯成一条缝,双手放在盘子附近。再往后一点,穿着深灰色上衣的女子用木筷从中央装满鲜红色腌菜的陶瓷盘中夹起一小块食物。中间靠后的穿着浅灰色毛衣的女子温柔地笑着,双手轻轻交叠放在身前,观察着互动。在视频的剩余时间里,家庭成员继续着他们生动的身体互动,嘴巴在持续的、无声的对话节奏中移动,而前景模糊的拉面碗冒出的浓密白色蒸汽从未停止,为这个温暖的聚会增添了舒适的氛围。\n\noverall_soundscape: 音景开始时是安静的室内基调,混合着前景热拉面碗冒出的浓密蒸汽发出的微弱、轻盈的沙沙声,伴随着浓郁汤底发出的微妙、持续的嘶嘶声和冒泡声。当视觉焦点向房间深处转移时,热闹的家庭晚餐的物理声音成为前景的主导。家庭成员取食物时,陶瓷碗和木筷接触盘子发出的清晰、尖锐的叮当声清晰可闻。随后是杯子放在光滑木桌上的微弱、沉闷的撞击声,以及家庭成员身体前倾和打手势时棉麻衣物发出的微妙、有节奏的沙沙声,完美捕捉了共享餐点时活泼、真实的氛围。\n\nnon_diegetic_music: 一段温柔、暖心的原声吉他旋律在背景中轻轻播放,伴随着传统日本 koto 琴发出的微妙、共鸣的音符。音乐保持缓慢、舒适的节奏,增强了家庭聚会的温馨、怀旧和欢乐氛围。"
    },
    "duration": 8,
    "usage": {
      "total_tokens": 22822,
      "prompt_tokens": 12800,
      "completion_tokens": 10022
    },
    "ratio": "16:9",
    "task_type": "h3_context_ir",
    "modality": "text"
  }
}
H3-Base查看脚本i2va.mp4
H3-Regenerate-2K查看脚本i2va_2k.mp4
通过直接调用开放平台 API 获得的 2K 参考结果查看脚本i2va_direct_2k.mp4
通过直接调用开放平台 API 获得的 768P 参考结果查看脚本i2va_direct_768p.mp4

case-Ref2VA

  • 类型:多模态参考转视频(视频 + 音频)
  • 时长:5 秒
  • 宽高比:自适应
阶段请求结果
H3-Context-IR查看脚本
{
  "task": {
    "id": "<task_id>",
    "model": "MiniMax-H3",
    "status": "succeeded",
    "created_at": "<created_at>",
    "updated_at": "<updated_at>",
    "content": {
      "prompt": "subject_definitions:\n<Subject 1> 是<Video 1>中那个留着短波浪金发、穿着亮粉色西装外套、配套粉色长裤、未扣纽扣的白色衬衫并戴着银戒指、怀里抱着一只小黑羊的年轻男子。\n<Video 1> 是用于编辑任务的源视频。\n<Audio 1> 是<Video 1>的同步音轨,提供背景音乐。\n<Audio 2> 是<Subject 1>声音的音色参考,包含一个男性旁白。\n\nsummary:\n[视频编辑 + 音频参考 + 音频复用] 目标视频是<Video 1>的编辑版本。<Subject 1>穿着亮粉色西装,抱着小黑羊,站在有其他白色小羊的草地背景中。此编辑对<Subject 1>的面部进行动画处理,使其说出用户提供的对话。<Audio 1>部分被复用为持续的背景音乐,而目标视频参考<Audio 2>中沉稳的男性声音音色作为<Subject 1>的对白。\n\nretention_analysis:\n<Subject 1>(出现在[镜头 1]):fully_preserved - 该男子保留其身份、波浪金发、粉色西装、白色衬衫、配饰以及他怀抱的小黑羊,其嘴巴被新制作为说话动画。\n<Video 1>(源视频编辑):fully_preserved - 原始的镜头构图、温暖的黄金时刻光线、草地山丘场景以及背景中的白色小羊均被保留,同时对中心人物进行了编辑。\n<Audio 1>: partially_copy - <Audio 1>中的氛围背景音乐在目标视频中被复用,混合在新添加的对白之下。\n<Audio 2>: reference - 目标音频参考<Audio 2>中的男性声音音色来生成<Subject 1>的对白。\n\ndetailed_description:\n目标视频采用逼真的摄影风格。\n[镜头 1] 镜头从源<Video 1>开始,展示<Subject 1>,一个留着短波浪金发的年轻男子,穿着亮粉色西装外套、配套粉色长裤和随意解开纽扣的白色衬衫。他自信地站在阳光明媚的绿色牧场上,怀里稳稳地抱着一只小黑羊。温暖的黄金时刻光线在他的脸上和亮粉色西装面料上投下柔和的阴影。在他身后,几只白色小羊在起伏的草地上站立和吃草,背景是清澈的淡蓝色天空。<Audio 1>中的氛围背景音乐在整个场景中持续播放。<Subject 1>真实地说话,他的嘴部动作自然地与新对话同步,其声音音色参考了<Audio 2>中沉稳的男性语调。<Subject 1>(S1)若有所思地向前看,轻声说道:<d>[English] Follow the wind, live free.</d> 当他说出这句话时,他微妙地变换了重心,抱着正在休息的小黑羊,同时镜头缓慢推进。<Subject 1>(S1)继续他的思考:<d>[English] Leave worries behind, enjoy the moment.</d> 就在他的声音停止的那一刻,他的嘴唇形成一个放松、平和的微笑,下巴停止了说话的动作。然后他将目光略微转向地平线,用手指轻轻抚摸小黑羊的羊毛,镜头在这宁静、阳光明媚的状态下保持到视频结束。\n\noverall_soundscape:\n音景由<Audio 1>中持续的氛围背景音乐组成,叠加在主角清晰、沉稳的男性对白之上,对白参考了<Audio 2>的声音音色。\n\nnon_diegetic_music:\n<Audio 1>中的氛围、持续的背景音乐被复用为持续的配乐,在对白下方轻声播放。"
    },
    "duration": 5,
    "usage": {
      "total_tokens": 39299,
      "prompt_tokens": 33323,
      "completion_tokens": 5976
    },
    "ratio": "16:9",
    "task_type": "h3_context_ir",
    "modality": "text"
  }
}
H3-Base查看脚本r2va.mp4
通过直接调用开放平台 API 获得的 2K 参考结果查看脚本r2va_2k.mp4
开放平台中用于参考的 H3 API 2K查看脚本r2va_direct_2k.mp4
通过直接调用开放平台 API 获得的 768P 参考结果查看脚本r2va_direct_768p.mp4

提示词使用指南

VIDEO_PROMPT_WRITING_GUIDE_base_en.md

VIDEO_PROMPT_WRITING_GUIDE_ref_en.md

提升提示词技巧:https://github.com/MiniMax-AI/MiniMax-H3/tree/main/skills

许可协议

  • MiniMax H3 根据 MiniMax H3 社区许可协议 发布。
  • 许可协议常见问题
  • 申请表(仅适用于美国/欧盟/英国/韩国)

联系我们

请通过 model@minimax.io 与我们联系。