HuggingFace镜像/Qwen3.8-Flash-Next
模型介绍
文件和版本
分析

Qwen3.8-Flash-Next

[!Note] 本仓库包含后训练模型的模型权重和配置文件,采用 Hugging Face Transformers 格式。

这些模型资产兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等。

[!Tip] 对于希望获得免运维、可扩展的托管推理服务的用户,官方 Qwen API 服务由 Qwen Cloud 提供。

其中,Qwen3.8-Flash 是基于 Qwen3.8-Flash-Next 的官方版本,具备更多生产级特性,例如默认支持 1M 上下文长度、官方内置工具。更多信息,请参见 Qwen3.8-Flash 概览。

随着基础模型前沿不断迈向更大的参数规模和更长的上下文窗口,问题不再只是我们能够将模型扩展到多大,而是如何更高效地进行扩展。迈向惠及每个人的通用人工智能(AGI)的可持续进展,需要架构层面的创新。今天,我们分享朝这一方向迈出的具体一步:Qwen3.8-Flash-Next。

Qwen3.8-Flash-Next Architecture

这一将支撑 Qwen4 的架构实验预览,围绕对现代大语言模型(LLM)核心组件如何在大规模场景下交互的根本性重新思考而构建。

亮点

该架构下的首个开放权重发布版本是 Qwen3.8-Flash-Next,其引入了:

  • 结合 QSA 的混合注意力:Gated DeltaNet 与 Gated Attention 的组合被重构为 Gated DeltaNet 与 Qwen Sparse Attention(QSA)。与选择单个 token 进行处理不同,QSA 在微块级别工作。这显著降低了长上下文延迟,随着智能体负载在实际使用中的占比不断提升,这是一项关键收益。
  • 门控残差:带归一化的残差流是深度 LLM 训练可控的关键。Gated Residual 通过逐元素、数据依赖的读取门控和按分支的标量写入门控,调节流经加宽残差流的信息。这在各层之间带来更细粒度的表达能力,同时保持训练稳定并降低推理开销。
  • n-gram 嵌入:嵌入为参数扩展提供了一条独特路径,所需计算更少,且相比混合专家(MoE)更适合卸载。通过短 n-gram 进行索引,该方法使在内存受限加速器上进行参数扩展更加高效,且不牺牲质量。
  • 定制化训练方案:Muon 和 AdamW 优化器被应用于特定权重类别,以最大化效率。在重新拟合的扩展定律指导下,我们摒弃传统批大小预热,直接从目标批大小开始,大幅减少总优化器步数,同时安全支持更大学习率以实现稳健收敛。

更多详情,请参见我们的博客文章 Qwen3.8-Flash-Next 和技术报告。

我们期待与您共同开启这一新篇章,并在构建未来产品的过程中欢迎您的反馈。

模型概览

  • 类型:带有视觉编码器的因果语言模型
  • 训练阶段:预训练与后训练
  • 语言模型
    • 参数量:125B(激活 6B),另有 51B n-gram 嵌入和 4B MTP
    • 隐藏维度:2560
    • Token 嵌入:248320(填充后)
    • N-gram 嵌入:20,000,000(第 2 层的 bigrams/trigrams)
    • 层数:48
    • 隐藏布局:12 × (3 × (Gated DeltaNet → MoE) → 1 × (Qwen Sparse Attention → MoE))
    • Gated DeltaNet:
      • 线性注意力头数:V 为 48,QK 为 16
      • 头维度:128
    • Qwen Sparse Attention:
      • 注意力头数:Q 为 24,KV 为 2
      • 头维度:256
      • 旋转位置嵌入维度:64
      • 索引器结构:MQA,包含 4 个查询头和 1 个共享键头
      • 索引器头维度:128
      • 预算:512 个块或 2048 个 token
    • 混合专家
      • 专家数量:512
      • 激活专家数量:10 个路由 + 1 个共享
      • 专家中间维度:640
    • 门控残差:
      • 分支数量:4
      • 瓶颈秩:320
    • LM 输出:248320(填充后)
    • MTP:1 层,采用多步训练
  • 上下文长度:原生支持 262,144,可扩展至 1,000,000 个 token。

基准测试结果

.vl-table th{font-size:15px!important;line-height:1.2} .vl-table td:not(.benchmark-cell):not([colspan]){font-size:15px;line-height:1.2;vertical-align:middle} .vl-table .benchmark-cell{padding:12px 10px 12px 18px!important;vertical-align:middle} .vl-table .benchmark-capability{font-size:15px;font-weight:600;line-height:1.22;color:#171717} .vl-table .benchmark-name{margin-top:4px;font-size:11px;font-weight:400;line-height:1.2;color:#6B6B6B} .vl-table .metric-stack{display:flex;flex-direction:column;gap:7px;padding:3px 0} .vl-table .metric-label{font-size:10px;font-weight:400;line-height:1.1;color:#777} .vl-table .metric-value{margin-top:2px;font-size:15px;line-height:1.15;color:#171717} .vl-table .metric-pair{white-space:nowrap} .vl-table .metric-sep{color:#9A9A9A;padding:0 3px} @media (prefers-color-scheme: dark){ .vl-table th,.vl-table td[colspan]{color:#8DA2FF!important;border-bottom-color:#8DA2FF!important} .vl-table td[colspan]{background:rgba(10,46,254,0.22)!important} .vl-table .benchmark-capability,.vl-table .metric-value{color:#E8E8E8!important} .vl-table .benchmark-name,.vl-table .metric-label{color:#A3A3A3!important} }

语言

Qwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusDeepSeek-V4-Flash-0731Claude-Opus-4.6 (Max)
参数量
125B27B397B284B--
激活参数量
6B27B17B13B--
N-gram 嵌入参数量
51B--------
编程
智能体编程
DeepSWE 1.1
58.742.216.554.4--
智能体编程
SWE-bench Pro
62.561.755.856.053.4
多语言软件工程
SWE-bench Multilingual
81.073.875.8--77.5
仓库级代码生成
NL2Repo-Bench
48.142.341.154.247.6
智能体
长程办公任务
CoWorkBench
73.970.765.145.168.2
专业岗位任务
JobBench
55.733.427.641.336.6
前沿智能体任务
Agents' Last Exam
Pass@1
24.3
得分
51.2
Pass@1
20.4
得分
42.9
Pass@1
13.2
得分
33.6
Pass@1
25.2
得分
--
--
真实场景工具使用
Toolathlon Verified (Pass@1)
73.567.150.670.3--
通用
指令遵循
IFBench
81.379.579.179.262.5
科学推理
GPQA Diamond
91.789.290.390.891.3
跨学科推理
HLE
35.930.834.733.840.0
竞赛编程
LiveCodeBench v6
91.990.389.690.688.8

1. DeepSWE 1.1:在 Claude Code 和 mini-SWE-agent 评测框架下评估,temp=1.0,top_p=0.95,256K 上下文窗口。我们报告两个评测框架中的最高得分;尤其值得关注的是,Qwen3.8-Flash-Next 在 mini-SWE-agent 上表现最佳。
2. SWE-bench Pro:除 Claude-Opus-4.6 (Max) 采用官方公布得分外,所有模型均在 Claude Code 评测框架下评估,temp=1.0,top_p=0.95,256K 上下文窗口。存在问题的任务已修正,且所有基线模型均在优化后的基准上重新评估。
3. SWE-bench Multilingual:在 mini-SWE-agent 评测框架下评估,temp=1.0,top_p=0.95,256K 上下文窗口。
4. NL2Repo-Bench:在 Claude Code 评测框架下评估。为防止奖励作弊,我们禁用了试图访问特定仓库的 Bash 命令,例如 pip download、pip install 和 git clone。
5. CoWorkBench:内部自研协作基准,用于评估涵盖计算机科学、金融、法律、医疗及其他生产力领域的长程办公与生产力智能体任务。
6. HLE:由 GPT-4o 评判。
7. 每行中的最佳结果以粗体显示。
8. 空单元格(--):分数尚不可用或不适用。

视觉语言

Qwen3.8-Flash-NextQwen3.8-27BQwen3.7-PlusClaude-Opus-4.6 (Max)
智能体多模态能力
多模态工具使用
ClawEval-MM
Pass@3
64.4
均值
60.4
Pass@3
57.4
均值
56.9
Pass@3
57.4
均值
60.1
Pass@3
52.5
均值
54.7
应用重建
RecreationBench
49.947.130.2--
移动设备使用
AndroidWorld
84.581.981.062.0
计算机操作
OSWorld 2.0
二值
19.4
部分
52.3
二值
19.4
部分
48.0
二值
2.8
部分
21.5
--
视觉网页开发
Vision2Web
64.062.942.1--
通用多模态能力
具身智能
ERQA
72.365.569.840.8
长视频理解
LVBench
76.672.476.263.0
真实世界感知
RealWorldQA
88.585.986.973.9
视觉数学解题
MathVision
无 CI
90.6
含 CI
95.7
无 CI
90.0
含 CI
94.6
无 CI
90.3
含 CI
88.7
无 CI
65.5
科学图表分析
CharXiv (RQ)
无 CI
84.6
含 CI
90.6
无 CI
83.7
含 CI
90.2
无 CI
85.8
含 CI
85.9
无 CI
66.0

1. ClawEval-MM:分数以“pass@3 / 平均分”报告。Pass@3 表示在三次试验中至少通过一次的百分比,平均分为三次试验的平均得分。
2. RecreationBench:内部自研的长程应用重建基准,用于评估跨五大平台的 hybrid-agent 能力——桌面端(Ubuntu、macOS、Windows)、移动端(Android)和 Web 端。
3. OSWorld 2.0:分数以“binary / partial”报告。binary 分数表示获得完整任务奖励的任务百分比,partial 分数汇总所有任务获得的局部奖励。
4. Vision2Web:分数为 frontend、webpage 和 website 三类类别的平均值,使用 Claude Code harness 并由 gpt-5.4-2026-03-05 进行评判。
5. MathVision、CharXiv (RQ):分数以“without CI / with CI”报告。MathVision 中少量错误的 ground-truth 标注已经过人工核验后修正。我们模型的分数使用固定 prompt 进行评估,例如:“Please reason step by step, and put your final answer within \boxed{}.” 对于其他模型,我们报告使用与不使用 \boxed{} 格式两种运行结果中的较高分数。
6. 每行中的最佳结果以粗体显示。
7. 空白单元格(--)表示分数尚不可用或不适用。

## 快速开始 为了便于集成,我们建议通过 API 使用 Qwen3.8-Flash-Next。

部署 Qwen3.8-Flash-Next

[!Important] 不同推理框架的推理效率和吞吐量存在显著差异。 我们建议使用最新版本的框架,以确保最佳性能和兼容性。 对于生产负载或高吞吐量场景,强烈建议使用 SGLang、KTransformers 或 vLLM 等专用服务引擎。

Qwen3.8-Flash-Next 可通过主流推理框架进行部署,例如:

  • SGLang:Qwen3.8-Flash-Next Cookbook
  • vLLM:Qwen3.8-Flash-Next Recipe
  • TokenSpeed:Qwen3.8-Flash-Next Recipe

\n\n` before producing the final responses.

To disable thinking content and obtain direct response, refer to the examples here.

[!Tip] We recommend using the following sets of sampling parameters for generation:

  • Thinking Mode: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
  • Instruct (or non-thinking) mode: temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

Please note that the support for sampling parameters varies according to inference frameworks.

[!Tip] In multi-turn agentic tasks, lower reasoning effort does not always reduce overall task completion time. Although it may produce faster per-turn responses, it can also lead to insufficient analysis, more failures, and repeated retries, which may increase total latency and token consumption.

Qwen3.8-Flash-Next supports controlling thinking behavior via enable_thinking, preserve_thinking, and reasoning_effort.

Chat Completions API

The Chat Completions API can be used with most inference frameworks, as well as Qwen Cloud. Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.:

需要翻译成中文。保持标题:### API 使用?“API Usage” 可译为“API 使用”或“API 用法”。项目是模型文档,通俗专业优雅流畅。保留 Qwen3.8-Flash-Next。enable_thinking 等参数不翻译。Chat Completions API 可能作为专有名词/API 名称,不翻译?用户说变量、标签或专业名词等不要翻译。Chat Completions API 可保留英文或译为“Chat Completions API”(常见)。也许标题保留 #### Chat Completions API 更稳妥,因为 API 名称不翻译。内容里也可以保留 Chat Completions API。Qwen Cloud 可保留或译“Qwen 云”?项目名不翻译,平台名可能专业名词不翻译。保留 Qwen Cloud。

翻译:

API 使用

[!Important] Qwen3.8-Flash-Next 模型默认运行于思考模式,在生成最终响应前,会先输出以 <think>\n...</think>\n\n 标识的思考内容。 如需关闭思考内容并直接获得响应,请参考此处的示例。

[!Tip] 我们建议在生成时使用以下采样参数组合:

  • 思考模式:temperature=1.0、top_p=0.95、top_k=20、min_p=0.0、presence_penalty=0.0、repetition_penalty=1.0
  • 指令模式(或非思考模式):temperature=0.7、top_p=0.80、top_k=20、min_p=0.0、presence_penalty=1.5、repetition_penalty=1.0

请注意,不同推理框架对采样参数的支持情况可能有所不同。

[!Tip] 在多轮智能体任务中,降低推理强度并不总能缩短任务总完成时间。虽然它可能使单轮响应更快,但也可能导致分析不足、失败次数增多以及反复重试,从而增加总时延和 token 消耗。

Qwen3.8-Flash-Next 支持通过 enable_thinking、preserve_thinking 和 reasoning_effort 控制思考行为。

Chat Completions API

Chat Completions API 可适用于大多数推理框架,也支持 Qwen Cloud。 开始前,请确保已安装相应依赖,并配置好 API 密钥和 API 基础 URL,例如:

考虑“Before starting, make sure it is installed” 中 it 指什么?原文可能缺少包名?不要增删。可译“开始前,请确保已安装并完成 API 密钥与 API 基础 URL 配置,例如:” 但“it is installed” maybe SDK/客户端。为不增删,保留模糊:“开始前,请确保已安装并配置好 API 密钥和 API 基础 URL,例如:” 中文自然。

检查是否删减:每一句都保留。链接锚点不翻译。thinking mode maybe 思考模式。direct response 直接响应。sampling parameters 采样参数。inference frameworks 推理框架。multi-turn agentic tasks 多轮智能体任务。lower reasoning effort 降低推理强度/推理努力。reasoning effort 参数 reasoning_effort。可译为“推理强度”。total latency 总时延/总延迟。token 不翻译。

最终只输出翻译内容,无代码块?用户要求保持 Markdown 格式,原文不是代码块。输出 Markdown 文本即可。不要包含额外。

API 使用

[!Important] Qwen3.8-Flash-Next 模型默认运行于思考模式,在生成最终响应前,会先输出以 ` ...

` 标识的思考内容。

如需关闭思考内容并直接获得响应,请参考此处的示例。

[!Tip] 我们建议在生成时使用以下采样参数组合:

  • 思考模式:temperature=1.0、top_p=0.95、top_k=20、min_p=0.0、presence_penalty=0.0、repetition_penalty=1.0
  • 指令模式(或非思考模式):temperature=0.7、top_p=0.80、top_k=20、min_p=0.0、presence_penalty=1.5、repetition_penalty=1.0

请注意,不同推理框架对采样参数的支持情况可能有所不同。

[!Tip] 在多轮智能体任务中,降低推理强度并不总能缩短任务总完成时间。虽然它可能使单轮响应更快,但也可能导致分析不足、失败次数增多以及反复重试,从而增加总时延和 token 消耗。

Qwen3.8-Flash-Next 支持通过 enable_thinking、preserve_thinking 和 reasoning_effort 控制思考行为。

Chat Completions API

Chat Completions API 可适用于大多数推理框架,也支持 Qwen Cloud。 开始前,请确保已安装并配置好 API 密钥和 API 基础 URL,例如:

pip install -U openai

# Set the following accordingly
export OPENAI_BASE_URL="http://localhost:8000/v1"
export OPENAI_API_KEY="EMPTY"
仅文本输入
from openai import OpenAI
# Configured by environment variables
client = OpenAI()

messages = [
    {"role": "user", "content": "Write a Python function to merge two sorted linked lists."},
]

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-Flash-Next",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,  # on by default
            "preserve_thinking": True, # on by default
        },
    },
    reasoning_effort="xhigh",  # xhigh by default; supported levels are xhigh, medium, and low
    stream=True,
    stream_options={"include_usage": True},
)

reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content
    elif hasattr(delta, "reasoning") and delta.reasoning is not None:
        if not is_answering:
            print(delta.reasoning, end="", flush=True)
        reasoning_content += delta.reasoning

    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

messages.append({
    "role": "assistant",
    "content": answer_content,
    "reasoning_content": reasoning_content,
    "reasoning": reasoning_content,
})
图像输入
from openai import OpenAI
# Configured by environment variables
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg"
                }
            },
            {
                "type": "text",
                "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$"
            }
        ]
    }
]

chat_response = client.chat.completions.create(
    model="Qwen/Qwen3.8-Flash-Next",
    messages=messages,
)
print("Chat response:", chat_response)
视频输入
from openai import OpenAI
# Configured by environment variables
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "video_url",
                "video_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4"
                }
            },
            {
                "type": "text",
                "text": "How many porcelain jars were discovered in the niches located in the primary chamber of the tomb?"
            }
        ]
    }
]

chat_response = client.chat.completions.create(
    model="Qwen/Qwen3.8-Flash-Next",
    messages=messages,
)

# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`,
# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`).
# This feature is currently supported only in vLLM.
#
# By default, `fps=2` and `do_sample_frames=True`.
# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate.
# chat_response = client.chat.completions.create(
#     model="Qwen/Qwen3.8-Flash-Next",
#     messages=messages,
#     extra_body={
#         "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True},
#     }, 
# )

print("Chat response:", chat_response)
指令模式(或非思考模式)

Qwen3.8-Flash-Next 默认会在响应前进行思考。 你可以通过配置 API 参数,获取模型无需思考的直接响应。 例如,

from openai import OpenAI
# Configured by environment variables
client = OpenAI()

messages = [
    {
        "role": "user",
        "content": [
            {
                "type": "image_url",
                "image_url": {
                    "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png"
                }
            },
            {
                "type": "text",
                "text": "Where is this?"
            }
        ]
    }
]

chat_response = client.chat.completions.create(
    model="Qwen/Qwen3.8-Flash-Next",
    messages=messages,
    temperature=0.7,
    top_p=0.8,
    presence_penalty=1.5,
    extra_body={
        "top_k": 20,
        "chat_template_kwargs": {"enable_thinking": False},
    }, 
)
print("Chat response:", chat_response)

[!Note] 如果你使用的是 Qwen Cloud 的 API,除了修改 model 外,请使用 "enable_thinking": False,而不要使用 "chat_template_kwargs": {"enable_thinking": False}。

禁用保留思考

默认情况下,Qwen3.8-Flash-Next 会保留所有历史消息中的思考块,从而在整个对话过程中维持完整的推理轨迹。这种行为称为保留思考,可确保上下文完整连续,尤其适用于对决策一致性要求较高、需要减少重复推理的 Agent 场景。它还能提升 KV cache 的利用率,优化思考模式与非思考模式下的推理效率。

如果你希望只保留最近一条用户消息中的思考块,可以通过将 preserve_thinking 设置为 False 来禁用该行为:

from openai import OpenAI

# Configured by environment variables
client = OpenAI()
messages = [...]
chat_response = client.chat.completions.create(
    model="Qwen/Qwen3.8-Flash-Next",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {"preserve_thinking": False},
    },
)
print("Chat response:", chat_response)

[!Note] 如果你正在使用 Qwen Cloud 提供的 API,除了修改 model 外,请直接使用 "preserve_thinking": False,而不要将其包装在 chat_template_kwargs 中。

最佳实践

为获得最佳性能,我们推荐以下设置:

  1. 采样参数:我们建议采用以下采样参数组合:

    • 思考模式:temperature=1.0、top_p=0.95、top_k=20、min_p=0.0、presence_penalty=0.0、repetition_penalty=1.0
    • 指令(或非思考)模式:temperature=0.7、top_p=0.80、top_k=20、min_p=0.0、presence_penalty=1.5、repetition_penalty=1.0

    对于支持的框架,你可以将 presence_penalty 参数调整在 0 到 2 之间,以减少无休止的重复。不过,设置较高的值偶尔可能导致语言混杂,并使模型性能略有下降。

  2. 充足的输出长度:为优化智能体任务上的表现,建议分配足够的输出长度,使模型能够生成详尽且完整的回复。对于支持为内部推理和最终输出分别设置 token 限制的框架,我们建议在 1M 上下文长度内采用以下配置:

    • 推理内容:将最大输出长度设置为 262,144 tokens。
    • 最终回复:将最大输出长度设置为 131,072 tokens。

    这些设置能为复杂推理提供必要的容量,同时确保高质量最终交付内容拥有充足空间。

  3. 处理超长文本:Qwen3.8-Flash-Next 原生支持最长 262,144 tokens 的上下文长度。对于总长度(包括输入和输出)超过该限制的长程任务,建议使用 RoPE scaling 技术有效处理长文本,例如 YaRN。

    YaRN 目前已获得多个推理框架支持,例如 vLLM、SGLang 和 TokenSpeed。 一般来说,在支持的框架中启用 YaRN 有两种方式:

    • 修改模型配置文件:

      在 config.json 文件中,将 text_config 中的 rope_parameters 字段更改为:

      {
          "mrope_interleaved": true,
          "mrope_section": [
              11,
              11,
              10
          ],
          "rope_type": "yarn",
          "rope_theta": 10000000,
          "partial_rotary_factor": 0.25,
          "factor": 4.0,
          "original_max_position_embeddings": 262144
      }
    • 传入命令行参数:

      对于 vLLM,可以使用

      VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --max-model-len 1000000  

      对于 SGLang,可以使用

      SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server ... --json-model-override-args '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --context-length 1000000

      对于 TokenSpeed,可以使用

      TOKENSPEED_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 tokenspeed serve ... --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --max-model-len 1000000  

    [!NOTE] 所有主流开源框架实现的均为静态 YaRN,也就是说,缩放系数不会随输入长度变化而改变,这可能会对较短文本的性能造成影响。 我们建议仅在需要处理长上下文时修改 rope_parameters 配置。 也建议根据实际需要修改 factor。例如,如果你的应用典型上下文长度为 524,288 tokens,最好将 factor 设置为 2.0。

  4. 长视频理解:为优化纯文本和图像的推理效率,发布版 video_preprocessor_config.json 中的 size 参数采用了保守配置。建议将 video_preprocessor_config 文件中的 longest_edge 参数设置为 469,762,048(对应 224k 视频 token),以启用小时级视频的更高帧率采样,从而获得更好的性能。例如:

    {"longest_edge": 469762048, "shortest_edge": 4096}

    或者,通过引擎启动参数覆盖默认值。实现细节请参考:vLLM / SGLang。

引用

如果你发现我们的工作有所帮助,欢迎予以引用。

@techreport{qwen2026design,
    title       = {On the Design of {Qwen3.8-Next} Architecture: Evaluation, Efficiency, and Training Stability},
    author      = {{Qwen Team}},
    institution = {Alibaba Group},
    month       = {August},
    year        = {2026}
}

@misc{qwen3.8flashnext,
    title  = {{Qwen3.8-Flash-Next}: A New Architecture, Towards Ultimate Cost-Efficiency},
    author = {{Qwen Team}},
    month  = {August},
    year   = {2026},
    url    = {https://qwen.ai/blog?id=qwen3.8-flash-next}
}