HuggingFace镜像/Qwen3.8-27B-NVFP4
模型介绍
文件和版本
分析

[!Note] 该量化版本仅支持在 vLLM 中运行,不兼容 SGLang。其 lm_head 层已量化为 FP8 精度,SGLang 无法加载。

阅读我们的 Qwen3.8-27B 运行指南!

此 NVFP4 量化版本采用 Unsloth Dynamic V3.0(预览版),以实现业界领先的量化性能。

  • 支持开发者角色(Developer Role),使 Qwen3.8 能够在 Codex 等智能体工具中高效运作。
  • 支持 MTP(多令牌预测),实现快速推理。
  • Qwen3.8 现可在 Unsloth Desktop 中直接运行与微调。详见我们的指南。
  • 工具调用优化:改进嵌套对象解析,显著提升工具调用的成功率。
  • 下方展示了 4-bit Qwen3.8-27B 在 Unsloth Desktop 中的运行效果:
qwen3.8 unsloth desktop

Qwen3.8-27B

继 Qwen3.5 和 Qwen3.6 系列在社区中获得广泛采用之后,我们很高兴推出 Qwen3.8——这是迄今为止 Qwen 开源模型家族中能力最强的一代。

Qwen3.8 基于 Qwen3.5 的架构基础构建,在编程、专业工作、研究以及长周期智能体任务方面均实现了显著提升。Qwen3.8-27B 将这些进步凝练为一款紧凑且易于部署的稠密模型:它是一款原生视觉-语言模型,能够理解图像和视频,具备灵活的思维控制能力,专为可靠地完成复杂、多步骤任务而设计。

Qwen3.8 亮点

Qwen3.8-27B 具备以下增强特性:

  • 核心能力:在编程、专业工作、研究及长周期智能体任务方面实现全面改进。
  • 智能体执行:更强的自主规划能力与更佳的环境反馈处理,确保端到端任务完成更加可靠。
  • 下游兼容性:对主流测试框架和开发工具的支持更加广泛,便于集成到您现有的技术栈中。
  • 灵活的思维控制:思考模式默认开启,可根据请求单独关闭;推理深度可通过 reasoning_effort 调节,历史消息中的推理上下文可通过 preserve_thinking 保留。
  • 视觉语言理解:原生支持图像和视频理解,涵盖从 STEM 图表、文档到时长达数小时视频的多种场景。

模型概述

  • 类型:带视觉编码器的因果语言模型
  • 训练阶段:预训练与后训练
  • 语言模型
    • 参数量:27B
    • 隐藏维度:5120
    • Token 嵌入维度:248,320(已填充)
    • 层数:64
    • 隐藏层布局:16 ×(3 ×(门控 DeltaNet → FFN)→ 1 ×(门控注意力 → FFN))
    • 门控 DeltaNet:
      • 线性注意力头数:V 为 48,QK 为 16
      • 头维度:128
    • 门控注意力:
      • 注意力头数:Q 为 24,KV 为 4
      • 头维度:256
      • 旋转位置嵌入维度:64
    • 前馈网络:
      • 中间维度:17,408
    • LM 输出维度:248,320(已填充)
    • MTP(多 Token 预测):采用多步训练
  • 上下文长度:原生支持 262,144,可扩展至 1,000,000 tokens。

最佳实践

为获得最优性能,我们推荐以下配置:

  1. 采样参数:建议使用以下采样参数组合:

    • 思考模式:temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0
    • 指令(非思考)模式:temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0

    在支持的框架中,可将 presence_penalty 参数在 0 到 2 之间调整,以减少无休止的重复。但请注意,设置过高的值偶尔会导致语言混杂,并略微降低模型性能。

  2. 充足的输出长度:为优化智能体任务的性能,建议分配足够的输出长度,使模型能够生成详尽且全面的回复。对于支持分别设置内部推理和最终输出 token 上限的框架,建议在 1M 上下文长度内采用以下配置:

    • 推理内容:最大输出长度设为 262,144 tokens。
    • 最终回复:最大输出长度设为 131,072 tokens。

    这些设置为复杂推理提供了必要的空间,同时为高质量的最终输出保留了充足余量。

  3. 处理超长文本:Qwen3.8-27B 原生支持最长 262,144 tokens 的上下文长度。对于总长度(包括输入和输出)超出此限制的长周期任务,建议使用 RoPE 缩放技术(如 YaRN)来有效处理长文本。

  4. 长视频理解:为优化纯文本和图像的推理效率,发布的 video_preprocessor_config.json 中的 size 参数设置较为保守。建议将 video_preprocessor_config 文件中的 longest_edge 参数设置为 469,762,048(对应 224k 视频 tokens),以便对小时级视频启用更高的帧率采样,从而获得更优性能。例如:

    {"longest_edge": 469762048, "shortest_edge": 4096}

引用

如果您觉得我们的工作对您有帮助,欢迎引用我们。

@misc{qwen38,
    title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
    url = {https://qwen.ai/blog?id=qwen3.8},
    author = {{Qwen Team}},
    month = {August},
    year = {2026}
}