[!Note] 该量化版本仅支持在 vLLM 中运行,不兼容 SGLang。其
lm_head层已量化为 FP8 精度,SGLang 无法加载。
此 NVFP4 量化版本采用 Unsloth Dynamic V3.0(预览版),以实现业界领先的量化性能。
继 Qwen3.5 和 Qwen3.6 系列在社区中获得广泛采用之后,我们很高兴推出 Qwen3.8——这是迄今为止 Qwen 开源模型家族中能力最强的一代。
Qwen3.8 基于 Qwen3.5 的架构基础构建,在编程、专业工作、研究以及长周期智能体任务方面均实现了显著提升。Qwen3.8-27B 将这些进步凝练为一款紧凑且易于部署的稠密模型:它是一款原生视觉-语言模型,能够理解图像和视频,具备灵活的思维控制能力,专为可靠地完成复杂、多步骤任务而设计。
Qwen3.8-27B 具备以下增强特性:
reasoning_effort 调节,历史消息中的推理上下文可通过 preserve_thinking 保留。为获得最优性能,我们推荐以下配置:
采样参数:建议使用以下采样参数组合:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0在支持的框架中,可将 presence_penalty 参数在 0 到 2 之间调整,以减少无休止的重复。但请注意,设置过高的值偶尔会导致语言混杂,并略微降低模型性能。
充足的输出长度:为优化智能体任务的性能,建议分配足够的输出长度,使模型能够生成详尽且全面的回复。对于支持分别设置内部推理和最终输出 token 上限的框架,建议在 1M 上下文长度内采用以下配置:
这些设置为复杂推理提供了必要的空间,同时为高质量的最终输出保留了充足余量。
处理超长文本:Qwen3.8-27B 原生支持最长 262,144 tokens 的上下文长度。对于总长度(包括输入和输出)超出此限制的长周期任务,建议使用 RoPE 缩放技术(如 YaRN)来有效处理长文本。
长视频理解:为优化纯文本和图像的推理效率,发布的 video_preprocessor_config.json 中的 size 参数设置较为保守。建议将 video_preprocessor_config 文件中的 longest_edge 参数设置为 469,762,048(对应 224k 视频 tokens),以便对小时级视频启用更高的帧率采样,从而获得更优性能。例如:
{"longest_edge": 469762048, "shortest_edge": 4096}如果您觉得我们的工作对您有帮助,欢迎引用我们。
@misc{qwen38,
title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
url = {https://qwen.ai/blog?id=qwen3.8},
author = {{Qwen Team}},
month = {August},
year = {2026}
}