HuggingFace镜像/Qwen3.8-27B-GGUF
模型介绍
文件和版本
分析

阅读我们的 Qwen3.8-27B 运行指南!

Unsloth Dynamic 3.0 在精度上表现卓越,性能超越其他主流量化方案。

  • 隆重推出 Dynamic V3.0 GGUF 格式,实现顶尖精度与量化性能。
  • 在 Unsloth Desktop 中通过 思维开关 运行和微调 Qwen3.8。 下载适用于 Mac、Windows 和 Linux 的版本。 GitHub 仓库
  • 支持开发者角色,Qwen3.8 可用于 Codex 等代理工具及更多场景!
  • 工具调用改进:更好地解析嵌套对象,提升工具调用成功率。
  • 下方展示在 Unsloth Desktop 中运行的 4-bit Qwen3.8-27B 实例:
qwen3.8 unsloth desktop

各主流 Qwen3.8 GGUF 提供商对比分析。在相同体积下,Unsloth Dynamic v3.0 的 top-1% 精度比其他提供商高出 10% 以上。了解更多

qwen3.8 unsloth desktop

Qwen3.8-27B

继 Qwen3.5 和 Qwen3.6 系列被社区广泛采用之后,我们欣然推出 Qwen3.8——迄今为止 Qwen 开源模型家族中能力最强的一代。

Qwen3.8 以 Qwen3.5 的架构为基础,在编程、专业工作、研究以及长周期智能体任务方面均实现了显著提升。Qwen3.8-27B 将这些进步带入了紧凑且易于部署的稠密模型之中:一款原生支持图像与视频理解、具备灵活思考控制的视觉语言模型,旨在以更高的可靠性完成复杂多步任务。

Qwen3.8 亮点

Qwen3.8-27B 具备以下增强特性:

  • 核心能力:在编程、专业工作、研究及长周期智能体任务上全面改进。
  • 智能体执行:更强的自主规划与更好的环境反馈处理能力,带来更可靠的端到端任务完成效果。
  • 下游兼容性:更广泛地支持主流测试框架与开发工具,方便集成到您现有的技术栈中。
  • 灵活的思考控制:思考模式默认开启,可按请求单独关闭;推理深度可通过 reasoning_effort 进行调节,历史消息中的推理上下文可通过 preserve_thinking 予以保留。
  • 视觉语言理解:原生支持图像与视频理解,覆盖从 STEM 图表、文档到小时级视频的多种场景。

模型概览

  • 类型:带视觉编码器的因果语言模型
  • 训练阶段:预训练与后训练
  • 语言模型
    • 参数量:27B
    • 隐藏维度:5120
    • Token 嵌入维度:248,320(含填充)
    • 层数:64
    • 隐藏层布局:16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN))
    • Gated DeltaNet:
      • 线性注意力头数:V 为 48,QK 为 16
      • 头维度:128
    • Gated Attention:
      • 注意力头数:Q 为 24,KV 为 4
      • 头维度:256
      • 旋转位置编码维度:64
    • 前馈网络:
      • 中间维度:17,408
    • LM 输出:248,320(含填充)
    • MTP(多 Token 预测):经多步训练
  • 上下文长度:原生 262,144,可扩展至 1,000,000 tokens。

最佳实践

为获得最优性能,我们建议采用以下配置:

  1. 采样参数:建议使用以下采样参数组合:

    • 思考模式:temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0
    • 指令(非思考)模式:temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0

    在支持相应参数的框架中,可将 presence_penalty 参数在 0 到 2 之间调整,以减少无休止的重复。但需注意,较高的取值偶尔会导致语言混用及模型性能轻微下降。

  2. 充足的输出长度:为在智能体任务中实现最佳表现,我们建议分配足够的输出长度,使模型能够生成详尽全面的回复。对于支持分别设置内部推理与最终输出 token 上限的框架,我们建议在 1M 上下文长度内采用以下配置:

    • 推理内容:将最大输出长度设为 262,144 个 token。
    • 最终回复:将最大输出长度设为 131,072 个 token。

    上述设置为复杂推理提供了充足的空间,同时确保了高质量最终输出的余量。

  3. 超长文本处理:Qwen3.8-27B 原生支持长达 262,144 个 token 的上下文长度。对于总长度(含输入与输出)超出该限制的长时任务,我们建议采用 RoPE 缩放技术(如 YaRN)以有效处理长文本。

  4. 长视频理解:为优化纯文本和图像的推理效率,发布的 video_preprocessor_config.json 中 size 参数采用了较为保守的配置。建议将 video_preprocessor_config 文件中的 longest_edge 参数设置为 469,762,048(对应 224k 视频 token),以实现小时级视频的更高帧率采样,从而获得更优性能。例如:

    {"longest_edge": 469762048, "shortest_edge": 4096}

引用

如果您觉得我们的工作对您有帮助,欢迎引用我们。

@misc{qwen38,
    title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
    url = {https://qwen.ai/blog?id=qwen3.8},
    author = {{Qwen Team}},
    month = {August},
    year = {2026}
}