MoonshotAI/Kimi-K3
模型介绍
文件和版本
Pull Requests
讨论
分析
Kimi K3

Chat Homepage
Hugging Face Twitter Follow Discord ModelScope
License

📰  技术博客 |     📄  完整报告

1. 模型介绍

Kimi K3 是一款开源权重的原生多模态智能体模型,也是我们迄今为止性能最强大的模型。它是基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建的 2.8T 参数模型,具备原生视觉能力和 100 万 token 的上下文窗口。作为全球首个开源的 3T 级模型,Kimi K3 专为长周期编码、知识工作和推理等前沿智能场景设计。

核心特性

  • 全新架构:Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建,并通过 Stable LatentMoE 框架提升 MoE 稀疏性,可从 896 个专家中激活 16 个——与 Kimi K2 相比,整体缩放效率约提升 2.5 倍。
  • 长程编码能力:在极少人工干预的情况下,Kimi K3 能支持长时间工程会话,驾驭大规模代码库,并灵活调度终端工具——涵盖 GPU 内核优化、编译器开发,到视觉闭环游戏开发、CAD 设计,乃至芯片设计等领域。
  • 智能知识工作:Kimi K3 推动端到端知识工作,凭借原生多模态架构,可生成包含交互式可视化、小部件、仪表盘的深度研究成果,还能进行动态设计与视频编辑。
  • 原生多模态与超长上下文:Kimi K3 在同一模型内实现文本、图像、视频的理解,并支持 100 万 token 的上下文窗口。
  • 开放前沿权重:我们依据 Kimi K3 许可证发布完整的 Kimi K3 模型权重,让前沿智能技术开放用于研究、部署及进一步创新。

2. 模型概述

架构混合专家模型(Mixture-of-Experts, MoE)
总参数数量2.8T
激活参数数量104B
层数93
密集层数1
注意力层组成69 个 KDA + 24 个 Gated MLA
注意力隐藏维度7168
注意力头数96
潜在 MoE 维度3584
MoE 隐藏维度(每专家)3072
专家数量896
每 token 选择专家数16
共享专家数量2
词汇表大小160K
上下文长度1048576
注意力机制KDA & Gated MLA
激活函数SiTU-GLU
视觉编码器MoonViT-V2
视觉编码器参数401M
量化方式MXFP4 权重 / MXFP8 激活
(量化感知训练)
模态文本、图像

3. 评估结果

基准测试Kimi K3
(max)
Claude Fable 5
(max, w/ fallback)
GPT-5.6 Sol
(max)
Claude Opus 4.8
(max)
GPT-5.5
(xhigh)
GLM-5.2
(max)
推理与知识
GPQA Diamond93.592.694.191.093.591.2
CritPt23.428.632.320.927.120.9
AA-LCR74.770.073.767.774.371.3
HLE-Full43.5 / 56.053.3 / 63.044.5 / 58.049.8 / 57.941.4 / 52.2—
代码能力
DeepSWE67.570.073.059.067.046.2
ProgramBench77.876.877.671.970.863.7
Terminal-Bench 2.188.388.088.884.683.482.7
FrontierSWE81.286.671.366.764.967.3
SWE-Marathon42.035.039.040.014.013.0
PostTrainBench36.641.434.634.128.434.3
MLS-Bench-Lite48.349.946.242.835.540.4
SciCode58.760.256.153.556.150.5
Kimi Code Bench 2.072.976.964.871.769.064.2
智能体能力
BrowseComp91.288.090.484.384.4—
DeepSearchQA (F1)95.094.2—93.1——
ResearchRubrics76.2—73.873.564.071.1
GDPval-AA v2 (Elo)168617471736159314911510
Toolathlon-Verified76.577.974.976.273.559.9
MCPMark-Verified94.587.492.976.492.9—
MCP-Atlas84.284.783.683.682.882.6
AutomationBench30.829.129.727.222.712.9
JobBench54.357.445.448.438.343.4
AA-Briefcase (Elo)154815831495135411581260
Agents' Last Exam28.325.7†29.627.026.620.4
APEX-Agents41.043.339.939.438.535.6
OfficeQA Pro63.369.963.263.960.941.4
SpreadsheetBench 234.834.732.431.629.128.1
OSWorld-Verified84.885.083.083.479.0—
OSWorld 2.058.366.162.655.749.5—
SaaS-Bench60.1—61.456.143.8—
τ³-Banking33.426.833.027.631.326.8
Harvey Lab-AA94.693.687.291.186.391.0
CorpFin v271.671.864.466.768.466.1
Finance Agent v254.456.353.853.951.849.7
Legal Research Bench44.249.548.143.840.431.3
视觉
WorldVQA ForceAnswer51.056.741.839.138.5—
OmniDocBench91.189.885.887.989.4—
PerceptionBench58.557.259.747.255.8—
Video-MME (w. sub)90.0—89.586.089.3—
MMVU82.1—81.279.281.7—
BabyVision w/ python85.790.588.981.283.6—
MMMU-Pro81.6 / 83.481.2 / 86.583.0 / 84.678.9 / 82.781.2 / 83.2—
CharXiv (RQ)84.8 / 91.388.9 / 93.584.6 / 89.180.5 / 89.984.1 / 89.0—
MathVision94.3 / 97.894.8 / 98.695.8 / 97.886.7 / 97.192.2 / 96.8—
ZeroBench (pass@5)23.0 / 41.023.0 / 46.017.0 / 35.017.0 / 34.022.0 / 41.0—
脚注

所有 Kimi K3 的结果均在推理强度设为“max”且温度值为 1.0 的条件下获得。对于单步任务,如 GPQA Diamond、HLE-Full 以及无需工具的视觉基准测试,我们将 top-p 设置为 0.95;对于智能体任务,top-p 设置为 1.0。对于 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision 和 ZeroBench,每个单元格均按顺序报告未使用工具增强和使用工具增强(HLE-Full 使用通用工具,视觉基准测试使用 Python)时的分数。

  1. 推理与知识基准测试
    • CritPt 和 AA-LCR:分数引用自 2026 年 7 月 23 日的 Artificial Analysis。
  2. 编码基准测试
    • DeepSWE:Kimi K3 使用 Kimi Code 测试框架进行评估。GLM-5.2 的分数取自 GLM-5.2 发布博客;其余所有分数均来自官方 DeepSWE 排行榜,其中 Kimi K3 使用 mini-SWE-agent 测试框架获得 67.3 分。我们报告的是 DeepSWE v1.1 任务的结果。
    • Terminal-Bench 2.1:Kimi K3 使用 Kimi Code 测试框架进行评估。对于其他所有模型,我们报告不同测试框架下的最佳分数:GLM-5.2 使用 Claude Code(GLM-5.2 发布博客);Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2(Artificial Analysis);GPT-5.5 和 GPT-5.6 Sol 使用 Codex(OpenAI)。
    • ProgramBench:Kimi K3 使用 Kimi Code 测试框架进行评估。GLM-5.2 的分数来自 GLM-5.2 发布博客;其他所有分数均来自 Vals AI。
    • SWE-Marathon:Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.6 Sol 使用 Codex 测试框架进行评估。GLM-5.2 的分数来自 GLM-5.2 发布博客。我们的评估基于 2026 年 7 月 9 日官方任务(https://www.swe-marathon.org/)的 H20 校准分支,该分支早于最终 v1.1 版本发布:GPU 任务的 Docker 镜像、性能门控和参考验证程序已针对 H20 进行了重新校准,而正确性和反作弊验证器保持不变。此外,在我们的评估中,Claude Fable 5 在 35% 的任务上出现了回退情况,这可能对其测量性能产生了负面影响。
    • FrontierSWE:Kimi K3 使用 Kimi Code 测试框架进行评估,GPT-5.6 Sol 使用 Codex 测试框架进行评估;其他所有结果均来自 FrontierSWE。优势分数是使用官方评估脚本根据原始分数重新计算得出的,且截至 2026 年 7 月 16 日为最新数据。
    • PostTrainBench:GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用官方 PostTrainBench 的结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现,在最大推理强度下进行评估,在 H20 GPU(而非官方设置中的 H100)上进行三次运行取平均值——Kimi K3 和 Claude Fable 5 使用 Claude Code 测试框架,GPT-5.6 Sol 使用 Codex 测试框架。
    • MLS-Bench-Lite:Kimi K3 使用 Kimi Code 测试框架进行评估;GLM-5.2 和 Claude 系列模型使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。
    • SciCode:分数引用自 2026 年 7 月 23 日的 Artificial Analysis。
    • Kimi Code Bench 2.0(内部):Kimi K3 使用 Kimi Code 测试框架进行评估(使用 Claude Code 测试框架时得分为 73.7);GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。所有模型均在最大推理强度下进行评估,除了 GPT-5.5 使用“xhigh”设置。由于该基准测试包含网络安全和安全相关任务,我们还披露拒绝或回退任务的比例:Claude Fable 5 在 80 个任务中出现 13 次回退和 1 次拒绝;GPT-5.6 Sol 的网络防护功能拒绝了 80 个任务中的 10 个;GPT-5.5 在 80 个任务中有 3 次拒绝。
  3. 智能体基准测试
    • OfficeQA Pro:每个测试用例都为智能体提供完整的 PDF 语料库,所有 PDF 均渲染为图像,且无机器可读文本。
    • OfficeQA Pro 和 SpreadsheetBench 2:Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 测试框架进行评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 测试框架进行评估。
    • MCP-Atlas:所有模型均在 500 任务公开子集上进行评估,任务限制为 100 轮,使用 Gemini 3.1 Pro 作为评判者。
    • AutomationBench:所有模型均在 600 任务公开子集上进行评估,其他所有方面均遵循官方 GitHub 设置。
    • BrowseComp:我们采用在 300K tokens 时触发的上下文压缩策略。当使用完整的 1M token 上下文窗口且不进行上下文管理时,Kimi K3 的得分为 90.4。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5 的结果引用自 Anthropic 和 OpenAI。
    • GDPval-AA v2、AA-Briefcase、τ³-Banking、Harvey Lab-AA 和 APEX-Agents:分数引用自 2026 年 7 月 23 日的 Artificial Analysis 和 APEX-Agents 排行榜。对于 Harvey Lab-AA,我们报告标准通过率。
    • CorpFin v2、Finance Agent v2 和 Legal Research Bench:分数引用自 Vals AI。
    • Agents' Last Exam:分数引用自 2026 年 7 月 23 日的 官方排行榜;我们报告排行榜的主要通过率指标。在排行榜上,每个模型都与特定的测试框架配对:Kimi K3 搭配 Kimi Code;GPT-5.6 Sol 和 GPT-5.5 搭配 Codex;Claude Fable 5、Claude Opus 4.8 和 GLM-5.2 搭配 Claude Code。† Claude Fable 5 条目在 xhigh 强度下运行,40% 的任务被标注为降级。
  4. 多模态基准测试
    • 除了 ZeroBench 遵循官方设置运行五次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 的评估遵循官方协议,保留原始输入顺序,并将图像前置到文本输入。
    • PerceptionBench 是一个内部基准测试,专注于原子级视觉感知能力。

4. 原生 MXFP4 量化

Kimi K3 从 SFT 阶段开始应用量化感知训练,采用 MXFP4 权重与 MXFP8 激活值,以实现广泛的硬件兼容性。

5. 部署

[!Note] 您可以通过 https://platform.kimi.ai 访问 Kimi K3 的 API,选择 kimi-k3 即可,我们提供与 OpenAI/Anthropic 兼容的 API。目前,推荐在以下推理引擎上运行 Kimi K3:

  • vLLM — 参见 使用指南
  • SGLang — 参见 使用手册
  • TokenSpeed — 参见 使用指南

6. 模型使用

Kimi K3 始终启用思考功能,并会返回 reasoning_content。思考力度通过顶层请求字段 reasoning_effort 进行配置,支持 "low"、"high" 和 "max"(默认值为 "max")。

Kimi K3 采用保留思考历史的模式进行训练。对于多轮对话和工具调用,Kimi K3 要求将 API 返回的完整助手消息原样传递回 messages — 包括 reasoning_content 和 tool_calls,而不仅仅是 content:

import openai

def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):
    messages = [
        {
            "role": "user",
            "content": "Tell me three random numbers."
        },
        {
            "role": "assistant",
            "reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
            "content": "473, 921, 235"
        },
        {
            "role": "user",
            "content": "What are the other two numbers you have in mind?"
        }
    ]

    response = client.chat.completions.create(
        model=model_name,
        messages=messages,
        stream=False,
        max_tokens=4096,
        reasoning_effort="max",
    )
    # the assistant should mention 215 and 222 that appear in the prior reasoning content
    print(f"response: {response.choices[0].message.reasoning}")
    return response.choices[0].message.content

如需完整指南和示例(视觉输入、结构化输出、部分模式、工具选择、动态工具加载、上下文缓存),请参阅 Kimi K3 Quickstart 和 Thinking Effort。

编码代理框架

Kimi K3 与 Kimi Code CLI 作为其代理框架配合使用时效果最佳。我们诚挚邀请您尝试——在终端中运行 Kimi Code,并使用 /model 命令选择 Kimi K3。希望您能享受使用 Kimi K3 进行构建的过程,也非常期待收到您的反馈!


7. 许可证

代码仓库和模型权重均根据 Kimi K3 License 发布。


8. 联系我们

如有任何问题,请通过 support@moonshot.ai 与我们联系。