MiniMax-M3 是一款具备前沿级编码能力与智能体能力的多模态模型,它基于混合专家(Mixture-of-Experts)架构构建,拥有 100 万 token 的上下文窗口。该模型可处理文本、图像、视频及计算机使用输入,并生成文本输出,尤其在长周期编码任务、智能体与工具使用工作流以及长视频理解方面表现突出。
NVIDIA MiniMax-M3 NVFP4 模型已通过 Model Optimizer 进行量化。
本模型已准备好供非商业用途使用。
本模型并非由 NVIDIA 拥有或开发。该模型是应第三方的特定应用和使用场景需求而开发构建的;有关非 NVIDIA 方的信息,请参阅 MiniMax-M3 模型卡片。
管辖条款: 检查点的使用受 MiniMax 社区许可协议 管辖。
补充信息: 基于 MiniMax M3 构建。
全球
用例: MiniMax-M3 旨在用于跨文本、图像和视频的多模态理解;长视频理解(最长 30 分钟);长周期编码任务(8 小时以上);智能体与工具使用工作流;以及设计和创意任务。该模型支持两种推理模式,可按请求切换:思考模式适用于复杂推理和智能体任务,非思考模式适用于对延迟敏感的场景。
Hugging Face 2026 年 6 月 23 日,通过 https://huggingface.co/nvidia/MiniMax-M3-NVFP4
架构类型: Transformer
网络架构: 混合专家(多模态)
总参数: 4280 亿
激活参数: 每个 token 约 230 亿(A23B)
视觉编码器: 用于图像和视频输入的 ViT
输入类型: 文本、图像、视频
输入格式: 文本:字符串;图像:RGB 图像;视频:编码视频文件
输入参数: 一维(1D)、二维(2D)、三维(3D)
其他输入特性: 支持最长 30 分钟的长视频输入。
输入上下文长度(ISL): 100 万 token
输出类型: 文本
输出格式: 字符串
输出参数: 一维(1D)
其他输出属性: 无
我们的AI模型经过专门设计和/或优化,可在NVIDIA GPU加速系统上运行。通过利用NVIDIA的硬件(例如GPU核心)和软件框架(例如CUDA库),与仅使用CPU的解决方案相比,该模型实现了更快的训练和推理时间。
运行时引擎:
vLLM
支持的硬件微架构兼容性:
推荐操作系统:
将基础模型和微调模型集成到AI系统中时,需要使用特定用例数据进行额外测试,以确保安全有效的部署。遵循V模型方法论,在单元级和系统级进行迭代测试和验证至关重要,这有助于在部署前降低风险、满足技术和功能要求,并确保符合安全与伦理标准。
本模型采用nvidia-modelopt v0.44.0 进行NVFP4量化。
数据模态: 文本、图像、视频
图像训练数据量: 未公开
文本训练数据量: 未公开
训练数据收集方式: 未公开
训练数据标注方式: 未公开
训练属性: 未公开
数据集: GPQA Diamond、AA-LCR、τ²-Telecom、MMMU-Pro和SciCode
各数据集的数据收集方法: 混合、自动化、人工
各数据集的标注方法: 混合、自动化、人工
属性: 我们在推理、指令遵循、智能体、多模态和编码基准上对模型进行了评估:GPQA Diamond包含448道由生物学、物理学和化学领域专家编写的研究生级多选题;AA-LCR(人工分析长上下文推理)测试对跨多个文档的长上下文输入的推理和综合能力;τ²-Telecom(tau2-bench)是一个智能体工具使用基准,用于衡量电信客户服务领域中的多轮任务完成情况;MMMU-Pro是一个大规模多学科多模态理解基准,包含需要跨不同学术领域进行图像理解的具有挑战性的多选题;SciCode评估科学编码能力。
引擎: vLLM
测试硬件: NVIDIA Blackwell B200
本模型通过将MiniMax-M3的权重和激活量化为NVFP4数据类型得到。此优化将每个参数的位数从8位减少到4位,磁盘大小和GPU内存需求减少约2倍。
要使用vLLM部署此检查点,目前需要包含MiniMax-M3 NVFP4支持的 nightly docker 镜像,该支持来自vllm-project/vllm#46380(尚未发布稳定版本)。启动nightly镜像并运行以下示例命令:
vllm serve nvidia/MiniMax-M3-NVFP4 \
--tensor-parallel-size 8 \
--block-size 128 \
--tool-call-parser minimax_m3 \
--reasoning-parser minimax_m3 \
--enable-auto-tool-choiceNVFP4 量化精度(与 FP8 基准对比):
| 精度 | GPQA Diamond | AA-LCR | τ²-Telecom | MMMU-Pro | SciCode |
|---|---|---|---|---|---|
| FP8 | 92.53 | 76.62 | 92.22 | 71.97 | 49.90 |
| NVFP4 | 91.92 | 75.60 | 91.89 | 71.01 | 49.70 |
基准:原生 MXFP8 格式的 MiniMax-M3。测试参数:temperature=1.0,top_p=0.95,最大 token 数 65536。
基础模型的训练数据包含从互联网爬取的有毒语言和社会偏见内容。因此,该模型可能会放大这些偏见,尤其在收到有毒提示时可能返回有毒响应。即使提示本身不包含任何明确冒犯性内容,模型生成的答案也可能存在不准确、遗漏关键信息、包含无关或冗余文本等问题,从而产生社会不可接受或不受欢迎的文本。
NVIDIA 认为可信 AI 是一项共同责任,我们已制定相关政策和实践,以支持各类 AI 应用的开发。开发人员应与内部模型团队合作,确保该模型满足相关行业和用例的要求,并应对不可预见的产品误用问题。
请确保您对所有输入图像和视频内容拥有适当的权利和许可;如果图像或视频包含人物、个人健康信息或知识产权,生成的图像或视频不会模糊或保持所包含图像主体的比例。
如发现模型质量、风险、安全漏洞或 NVIDIA AI 相关问题,请通过 此处 报告。