HuggingFace镜像/DeepSeek-V4-Pro-0813
模型介绍
文件和版本
分析

DeepSeek-V4-Pro-0813

DeepSeek-V4

Homepage Chat
Hugging Face Twitter Follow
License

技术报告👁️

简介

DeepSeek-V4-Pro-0813 是 DeepSeek-V4-Pro 的官方正式版本,取代了此前的预览版。该版本大幅增强了智能体(Agent)能力,性能提升尤为显著,尤其在真实生产环境中表现突出。它基于 DeepSeek-V4-Pro(预览版)的模型架构构建,并额外集成了 DSpark 投机解码模块。

在下列基准测试中,DeepSeek-V4-Pro-0813 全面超越 DeepSeek-V4-Pro(预览版),并与目前最强的闭源模型总体实力相当。

基准测试DeepSeek-V4-Pro-0813DeepSeek-V4-Flash-0731DeepSeek-V4-Pro(预览版)DeepSeek-V4-Flash(预览版)GLM-5.2Kimi K3Opus-4.8Fable-5(含回退机制)
HLE(无工具 / 有工具)42.7 / 60.037.8 / 51.537.7 / 48.234.8 / 45.140.5 / 54.743.5 / 56.049.8 / 57.953.3 / 63.0
Terminal Bench 2.187.982.772.161.881.088.385.088.0
NL2Repo61.554.238.539.448.9-69.7-
Cybergym83.376.752.738.7-80.078.383.1
DeepSWE62.754.412.87.346.267.558.070.0
Toolathlon-Verified74.170.355.949.759.976.576.277.9
Agents' Last Exam25.725.216.515.823.827.625.7-
AutomationBench(公开)31.825.112.810.812.930.827.229.1
DSBench-FullStack †71.168.741.837.061.873.771.677.2
DSBench-Hard †67.259.631.125.854.563.071.768.3

说明:

  1. 在上述公开基准的代码智能体任务中,DeepSeek-V4-Pro-0813 采用 DeepSeek Harness 的最小模式作为智能体框架进行评估,推理力度设置为 max,使用 temperature = 1.0, top_p = 0.95。
  2. † DSBench-FullStack 为内部全栈开发测试集;DSBench-Hard 为内部高难度编码智能体任务测试集。

对话模板

本次发布未附带 Jinja 格式的对话模板。我们改而提供了一个专门的 encoding 文件夹,内含 Python 脚本及测试用例,演示如何将以 OpenAI 兼容格式编码的消息转换为模型的输入字符串,以及如何解析模型的文本输出。完整文档请参见 encoding 文件夹。

reasoning_effort 参数现支持三档设置——low、high 和 max——用于控制模型在作答前的思考深度。

简要示例如下:

from encoding_dsv4 import encode_messages, parse_message_from_completion_text

messages = [
    {"role": "user", "content": "hello"},
    {"role": "assistant", "content": "Hello! I am DeepSeek.", "reasoning_content": "thinking..."},
    {"role": "user", "content": "1+1=?"}
]

# messages -> string
prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max")

# string -> tokens
import transformers
tokenizer = transformers.AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V4-Pro-0813")
tokens = tokenizer.encode(prompt)

如何使用 vLLM 运行

只需一个标志即可启用 DSpark 推测解码——在 vLLM 启动命令中添加 --speculative-config 参数,并指定 method: dspark:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

例如,以下命令可在单个 4×GB300 节点上通过 vLLM 提供模型服务。 详细说明及其他硬件配置,请参阅 vLLM 配方。

vllm serve deepseek-ai/DeepSeek-V4-Pro-0813 \
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
  --data-parallel-size 4 --enable-expert-parallel \
  --moe-backend deep_gemm_mega_moe \
  --attention-config '{"use_fp4_indexer_cache": true}' \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

如何使用SGLang运行

通过设置--speculative-algorithm DSPARK启用DSpark,无需单独指定--speculative-draft-model-path,因为目标模型与草稿模型的权重来自同一检查点。

详细说明、基准测试及其他硬件配置,请参阅SGLang cookbook。

sglang serve \
  --trust-remote-code \
  --model-path deepseek-ai/DeepSeek-V4-Pro-0813 \
  --tp 4 \
  --moe-runner-backend flashinfer_mxfp4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.90 \
  --chunked-prefill-size 4096 \
  --swa-full-tokens-ratio 0.1 \

本地运行方法

请参阅 inference 文件夹,了解如何在本地运行 DeepSeek-V4 的详细说明,包括模型权重转换和交互式聊天演示。

对于本地部署,我们建议将采样参数设置为 temperature = 1.0,在智能体场景下使用 top_p = 0.95,其他场景下使用 top_p = 1.0。对于 high 和 max 推理强度级别,我们建议最大输出长度为 384K tokens。

许可证

本仓库及模型权重均基于 MIT 许可证 授权。

引用

@misc{deepseekai2026deepseekv4,
      title={DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence},
      author={DeepSeek-AI},
      year={2026},
}

联系方式

如有任何疑问,欢迎提交 issue 或通过 service@deepseek.com 与我们联系。