HuggingFace镜像/Qwen3-Next-80B-A3B-Instruct
模型介绍
文件和版本
分析

Qwen3-Next-80B-A3B-Instruct

Chat

过去几个月来,我们观察到,在追求更强大、更具智能体特性的人工智能(AI)过程中,扩展总参数规模与上下文长度的趋势愈发清晰。 我们很高兴分享针对这些需求的最新进展,其核心是通过创新的模型架构提升扩展效率。 我们将这一代基础模型命名为 Qwen3-Next。

核心亮点

Qwen3-Next-80B-A3B 是 Qwen3-Next 系列的首款模型,具有以下关键增强:

  • Hybrid Attention:以 Gated DeltaNet 与 Gated Attention 的组合替代标准注意力机制,实现对超长上下文的高效建模。
  • High-Sparsity Mixture-of-Experts (MoE):在 MoE 层中实现极低的激活比例,在保持模型容量的同时,大幅降低每个 token 的 FLOPs。
  • 稳定性优化:包括 zero-centered and weight-decayed layernorm 等技术,以及其他用于稳健预训练和后训练的稳定化增强。
  • Multi-Token Prediction (MTP):提升预训练模型性能并加速推理。

在参数效率与推理速度方面,Qwen3-Next-80B-A3B 均展现出强劲表现:

  • Qwen3-Next-80B-A3B-Base 以 10% 的总训练成本,在下游任务上超越 Qwen3-32B-Base,并在上下文长度超过 32K tokens 时实现 10 倍推理吞吐量。
  • Qwen3-Next-80B-A3B-Instruct 在部分基准测试中与 Qwen3-235B-A22B-Instruct-2507 表现相当,同时在处理长达 256K tokens 的超长上下文任务时展现出显著优势。

Qwen3-Next-80B-A3B-Instruct 基准测试对比

如需了解更多详情,请参阅我们的博客文章 Qwen3-Next。

blocks in its output.” 翻译成 “仅支持 instruct(非思考)模式,并在其输出中不生成`` 块。” 但 instruct/non-thinking 专业?保留 instruct? “instruct (non-thinking) mode” 可译为“指令(非思考)模式”。 项目名保留。

列表:

  • Type: Causal Language Models -> 类型:Causal Language Models
  • Training Stage: Pretraining (15T tokens) & Post-training -> 训练阶段:Pretraining(15T tokens) & Post-training? 或 预训练(15T tokens)与后训练? 专业名词 Pretraining/Post-training 是否翻译? 行业术语符合领域表达,中文常说“预训练(15T tokens)与后训练”。 但“专业名词等不要翻译”可能不允许? 我觉得 Training Stage 的描述可翻译为“预训练(15T tokens)与后训练”更自然。 但保留 token? “tokens” 可翻译为“token”或“词元”? 专业名词 token 常保留。 15T tokens 保留 “15T tokens”。
  • Number of Parameters: 80B in total and 3B activated -> 参数量:总计 80B,激活 3B。 但 “Number of Parameters” 翻译。
  • Number of Paramaters (Non-Embedding): 79B (原文拼写 Paramaters,不要修?可以翻译为“参数量(非嵌入):79B”。 不改变原文? 可保留拼写错误? 翻译内容不能删减省略,但可修正? 最好保留原文字段名? “Number of Paramaters (Non-Embedding)” 翻译为 “参数量(非嵌入):79B”。 英文字段可翻译。
  • Hidden Dimension: 2048 -> 隐藏维度:2048
  • Number of Layers: 48 -> 层数:48
    • Hybrid Layout: 12 * (3 * (Gated DeltaNet -> MoE) -> 1 * (Gated Attention -> MoE)) -> 混合布局:12 * (3 * (Gated DeltaNet -> MoE) -> 1 * (Gated Attention -> MoE)) 保留架构组件。
  • Gated Attention: -> Gated Attention:
    • Number of Attention Heads: 16 for Q and 2 for KV -> 注意力头数量:Q 为 16,KV 为 2
    • Head Dimension: 256 -> 头维度:256
    • Rotary Position Embedding Dimension: 64 -> Rotary Position Embedding 维度:64 (RPE 是专业名词?保留)
  • Gated DeltaNet: -> Gated DeltaNet:
    • Number of Linear Attention Heads: 32 for V and 16 for QK -> 线性注意力头数量:V 为 32,QK 为 16
    • Head Dimension: 128 -> 头维度:128
  • Mixture of Experts: -> Mixture of Experts: 或“专家混合:”? 专业名词保留。
    • Number of Experts: 512 -> 专家数量:512
    • Number of Activated Experts: 10 -> 激活专家数量:10
    • Number of Shared Experts: 1 -> 共享专家数量:1
    • Expert Intermediate Dimension: 512 -> 专家中间维度:512
  • Context Length: 262,144 natively and extensible up to 1,010,000 tokens -> 上下文长度:原生 262,144,可扩展至 1,010,000 tokens

图片:保留 img,title 可能翻译? title="Qwen3-Next Model Architecture" 中 Qwen3-Next 是名称不翻译,Model Architecture 可翻译为“模型架构”? 但规则标签/专业名词? title 是文本内容,可翻译为 “Qwen3-Next 模型架构”。 保持 Markdown 格式。 可以修改 title? 翻译内容,应该翻译 title 的英文。 但不翻译项目名。 “Qwen3-Next Model Architecture” -> “Qwen3-Next 模型架构”。

Performance 表:表头第一空保留,模型名保留。 行名:Knowledge, Reasoning, Coding, Alignment, Agent, Multilingualism 是类别,翻译为“知识”“推理”“编码”“对齐”“智能体”“多语言”。 专业名词 benchmark 名保留。 表内加粗保留。 *: For reproducibility, we report the win rates evaluated by GPT-4.1. -> *: 为保证可复现性,我们报告由 GPT-4.1 评估的胜率。 或“为便于复现,我们报告经 GPT-4.1 评估的胜率。” 更优雅。

需要输出仅翻译内容,无解释。 必须保持原始 Markdown 格式。 注意原文表格中有 “| | Qwen3-30B-A3B-Instruct-2507 | ...” 空表头保留。 数字和加粗保留。

考虑“instruct (non-thinking) mode”:在 Qwen 文档中通常中文为“指令(非思考)模式”。 输出中不生成 </think> blocks:保留反引号代码格式。 原文 “ </think>” 是双反引号包裹 think tags,应保留。

“Model Overview” -> “模型概述”。

需要确保没有多余。 最终仅给出 Markdown。 不要添加 ```? 用户要求保持原始 Markdown,原文本身有 Markdown 但不是代码块。 直接输出内容。

检查术语:Causal Language Models 是否翻译? 如果保留,列表第一项 “类型:Causal Language Models”。 这符合专业名词不翻译。 Training Stage 中 Pretraining/Post-training 是否保留? 可能保留为“训练阶段:Pretraining(15T tokens) & Post-training”。 但中文文档中更常见“预训练与后训练”。 用户要求通俗、专业、优雅且流畅,不机器翻译。 行业术语符合表达习惯。 对于 Pretraining/Post-training,中文领域术语就是“预训练/后训练”,不算变量/标签。 应该翻译。 Mixture of Experts 是架构组件,可能中文“混合专家”或“专家混合(MoE)”。 但原文有 MoE 在公式中保留。 作为标题可保留英文? 中文技术文档常写“混合专家(Mixture of Experts)”但这里要简洁。 规则“专业名词等不要翻译”可能建议保留 Gated DeltaNet, Gated Attention, Mixture of Experts。 但 “Mixture of Experts” 可翻译为“混合专家”,更通俗。 然而下面 MoE 保留。 我倾向保留 “Mixture of Experts” 作为组件名,因为与架构名同类。 但中文读者能懂。 “Hidden Dimension” 翻译为“隐藏维度”。 “Rotary Position Embedding Dimension” 可译为“旋转位置编码维度”? RPE 是专业名词,中文常说“旋转位置编码”。 但规则专业名词不翻译? 可能翻译为“旋转位置编码维度”符合行业表达。 如果保留 “Rotary Position Embedding 维度” 有点生硬。 用户要求通俗专业优雅,所以“旋转位置编码维度”更自然。 但是“专业名词不要翻译”又矛盾。 我的判断:可翻译通用术语,但不翻译模型名、基准名、组件名? Gated DeltaNet 和 Gated Attention 保留,因为组件命名。 Rotary Position Embedding 是技术名,可译为“旋转位置编码”。 但“专业名词”包括它吗? 也许应该保留英文以避免错误。 中文 AI 文档中 “Rotary Position Embedding (RoPE)” 常见保留或中文“旋转位置编码”。 为流畅,选择“旋转位置编码维度”。

“Number of Attention Heads: 16 for Q and 2 for KV” -> “注意力头数量:Q 为 16,KV 为 2”。 专业符号保留。

“Number of Linear Attention Heads: 32 for V and 16 for QK” -> “线性注意力头数量:V 为 32,QK 为 16”。

“Context Length: 262,144 natively and extensible up to 1,010,000 tokens” -> “上下文长度:原生支持 262,144,可扩展至 1,010,000 tokens”。 原句无“支持”,可加。 不删减。 “natively” 译为“原生”。

表格脚注:*: For reproducibility, we report the win rates evaluated by GPT-4.1. -> *: 为保证可复现性,我们报告由 GPT-4.1 评估的胜率。 或者 “为便于复现,我们报告经 GPT-4.1 评估的胜率。” “win rates” 在评测中可译“胜率”或“胜场率”。 Arena-Hard v2 可能胜率。 用“胜率”即可。

需要保留所有换行? 可尽量保持。

可能 “Non-Thinking” 表头是模型变体名称,不翻译? 原文表头 “Qwen3-32B Non-Thinking” 是模型名称/变体,项目名称等不翻译,应该整体保留,不翻译 Non-Thinking。 用户说项目名称等不需要翻译。 表头模型名保留。 不要将 Non-Thinking 译为“非思考”。 同样 Qwen3-235B-A22B-Instruct-2507 保留。

“instruct (non-thinking) mode” 这里不是模型名,是模式,可译为“指令(非思考)模式”。

注意原文 “Number of Paramaters” 拼写错误,翻译成“参数量”即可,不保留错误? 不删减意思。 OK。

最终:

模型概述

[!Note] Qwen3-Next-80B-A3B-Instruct 仅支持 instruct(非思考)模式,并在其输出中不生成 </think> 块。

Qwen3-Next-80B-A3B-Instruct 具有以下特性:

  • 类型:Causal Language Models
  • 训练阶段:预训练(15T tokens)与后训练
  • 参数量:总计 80B,激活 3B
  • 参数量(非嵌入):79B
  • 隐藏维度:2048
  • 层数:48
    • 混合布局:12 * (3 * (Gated DeltaNet -> MoE) -> 1 * (Gated Attention -> MoE))
  • Gated Attention:
    • 注意力头数量:Q 为 16,KV 为 2
    • 头维度:256
    • 旋转位置编码维度:64
  • Gated DeltaNet:
    • 线性注意力头数量:V 为 32,QK 为 16
    • 头维度:128
  • Mixture of Experts:
    • 专家数量:512
    • 激活专家数量:10
    • 共享专家数量:1
    • 专家中间维度:512
  • 上下文长度:原生 262,144,可扩展至 1,010,000 tokens

<img ... title="Qwen3-Next 模型架构" />

性能

表格...

表头空第一列保留。 行名加粗翻译。

“LiveBench 20241125” 保留。 “LiveCodeBench v6 (25.02-25.05)” 保留。 “MultiPL-E” 保留。 “Aider-Polyglot” 保留。 “IFEval”保留。 “Arena-Hard v2*” 保留星号。 “Creative Writing v3” 可译为“创意写作 v3”? 这是基准名/子类别,可能基准名称保留。 但 “Creative Writing v3” 是评测项,英文专有名词,保留更稳。 用户说专业名词不要翻译,所以保留。 “WritingBench” 保留。 “BFCL-v3” 保留。 “TAU1-Retail” 等保留。 “MultiIF” 保留。 “MMLU-ProX” 保留。 “INCLUDE” 保留。 “PolyMATH” 保留。

“Knowledge” 等类别不是基准名,翻译。

“Agent” 翻译为“智能体”。 或“代理”? AI 领域 agent 常用“智能体”。

“Multilingualism” -> “多语言” 或“多语言能力”。 原文类别,翻译为“多语言”。

Check table: first header row: | | Qwen3... | etc. Need align? Keep.

Potential issue: “instruct (non-thinking) mode” if we translate instruct to “指令” but maybe instruct is mode name? In Qwen, “instruct” maybe “指令微调”? “instruct (non-thinking) mode” = “指令(非思考)模式”。 OK.

Need no code fences. Final only. Ensure no extra.

模型概述

[!Note] Qwen3-Next-80B-A3B-Instruct 仅支持 instruct(非思考)模式,并在其输出中不生成 </think> 块。

Qwen3-Next-80B-A3B-Instruct 具有以下特性:

  • 类型:Causal Language Models
  • 训练阶段:预训练(15T tokens)与后训练
  • 参数量:总计 80B,激活 3B
  • 参数量(非嵌入):79B
  • 隐藏维度:2048
  • 层数:48
    • 混合布局:12 * (3 * (Gated DeltaNet -> MoE) -> 1 * (Gated Attention -> MoE))
  • Gated Attention:
    • 注意力头数量:Q 为 16,KV 为 2
    • 头维度:256
    • 旋转位置编码维度:64
  • Gated DeltaNet:
    • 线性注意力头数量:V 为 32,QK 为 16
    • 头维度:128
  • Mixture of Experts:
    • 专家数量:512
    • 激活专家数量:10
    • 共享专家数量:1
    • 专家中间维度:512
  • 上下文长度:原生 262,144,可扩展至 1,010,000 tokens

性能

Qwen3-30B-A3B-Instruct-2507Qwen3-32B Non-ThinkingQwen3-235B-A22B-Instruct-2507Qwen3-Next-80B-A3B-Instruct
知识
MMLU-Pro78.471.983.080.6
MMLU-Redux89.385.793.190.9
GPQA70.454.677.572.9
SuperGPQA53.443.262.658.8
推理
AIME2561.320.270.369.5
HMMT2543.09.855.454.1
LiveBench 2024112569.059.875.475.8
编码
LiveCodeBench v6 (25.02-25.05)43.229.151.856.6
MultiPL-E83.876.987.987.8
Aider-Polyglot35.640.057.349.8
对齐
IFEval84.783.288.787.6
Arena-Hard v2*69.034.179.282.7
Creative Writing v386.078.387.585.3
WritingBench85.575.485.287.3
智能体
BFCL-v365.163.070.970.3
TAU1-Retail59.140.171.360.9
TAU1-Airline40.017.044.044.0
TAU2-Retail57.048.874.657.3
TAU2-Airline38.024.050.045.5
TAU2-Telecom12.324.632.513.2
多语言
MultiIF67.970.777.575.8
MMLU-ProX72.069.379.476.7
INCLUDE71.970.979.578.9
PolyMATH43.122.550.245.9

*: 为保证可复现性,我们报告由 GPT-4.1 评估的胜率。

快速开始

Qwen3-Next 的代码已合并到 Hugging Face 的 transformers 主分支。

pip install git+https://github.com/huggingface/transformers.git@main

在较早版本中,您会遇到以下错误:

KeyError: 'qwen3_next'

以下内容包含一段代码示例,说明如何基于给定输入使用模型生成内容。

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen3-Next-80B-A3B-Instruct"

# load the tokenizer and the model
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    dtype="auto",
    device_map="auto",
)

# prepare the model input
prompt = "Give me a short introduction to large language model."
messages = [
    {"role": "user", "content": prompt},
]
text = tokenizer.apply_chat_template(
    messages,
    tokenize=False,
    add_generation_prompt=True,
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)

# conduct text completion
generated_ids = model.generate(
    **model_inputs,
    max_new_tokens=16384,
)
output_ids = generated_ids[0][len(model_inputs.input_ids[0]):].tolist() 

content = tokenizer.decode(output_ids, skip_special_tokens=True)

print("content:", content)

[!Note] Multi-Token Prediction (MTP) 在 Hugging Face Transformers 中尚未普遍可用。

[!Note] 效率或吞吐量的提升在很大程度上取决于具体实现。 对于推理任务,建议使用专门的推理框架,例如 SGLang 和 vLLM。

[!Tip] 根据推理配置的不同,使用 flash-linear-attention 和 causal-conv1d 可能会获得更高的效率。 详细操作说明和要求请参阅上述链接。

部署

在部署时,你可以使用最新的 sglang 或 vllm 创建兼容 OpenAI 的 API 端点。

SGLang

SGLang 是一个面向大型语言模型和视觉语言模型的高速推理服务框架。 SGLang 可用于启动提供兼容 OpenAI API 服务的服务器。

Qwen3-Next 需要 sglang>=0.5.2,可通过以下命令安装:

pip install 'sglang[all]>=0.5.2'

有关更多详细信息,请参见其文档。

以下命令可用于在 http://localhost:30000/v1 创建 API 端点,最大上下文长度为 256K tokens,并在 4 块 GPU 上使用张量并行。

python -m sglang.launch_server --model-path Qwen/Qwen3-Next-80B-A3B-Instruct --port 30000 --tp-size 4 --context-length 262144 --mem-fraction-static 0.8

MTP 建议使用以下命令,其余设置与上文保持一致:

python -m sglang.launch_server --model-path Qwen/Qwen3-Next-80B-A3B-Instruct --port 30000 --tp-size 4 --context-length 262144 --mem-fraction-static 0.8 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4

[!Note] 默认上下文长度为 256K。如果服务无法启动,建议将上下文长度降低到更小的值,例如 32768。

也请参阅 SGLang 关于 Qwen3-Next 的使用指南。

vLLM

vLLM 是面向 LLM 的高吞吐、内存高效的推理与服务引擎。 vLLM 可用于启动支持 OpenAI 兼容 API 的服务。

Qwen3-Next 需要 vllm>=0.10.2,可通过以下方式安装:

pip install 'vllm>=0.10.2'

有关更多详情,请参阅 其文档。

以下命令可用于在 4 块 GPU 上通过 tensor parallel 创建最大上下文长度为 256K tokens 的 API 端点,地址为 http://localhost:8000/v1。

vllm serve Qwen/Qwen3-Next-80B-A3B-Instruct --port 8000 --tensor-parallel-size 4 --max-model-len 262144

对于 MTP,推荐使用以下命令,其余设置与上述保持一致:

vllm serve Qwen/Qwen3-Next-80B-A3B-Instruct --port 8000 --tensor-parallel-size 4 --max-model-len 262144 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}'

[!Note] 默认上下文长度为 256K。如果服务无法启动,建议将上下文长度调小至更小的值,例如 32768。

另请参阅 vLLM 关于 Qwen3-Next 的使用指南。

智能体使用

Qwen3 在工具调用能力方面表现出色。我们建议使用 Qwen-Agent 以充分发挥 Qwen3 的智能体能力。Qwen-Agent 内部封装了工具调用模板和工具调用解析器,可大幅降低编码复杂度。

要定义可用工具,你可以使用 MCP 配置文件、使用 Qwen-Agent 内置工具,或自行集成其他工具。

from qwen_agent.agents import Assistant

# Define LLM
llm_cfg = {
    'model': 'Qwen3-Next-80B-A3B-Instruct',

    # Use a custom endpoint compatible with OpenAI API:
    'model_server': 'http://localhost:8000/v1',  # api_base
    'api_key': 'EMPTY',
}

# Define Tools
tools = [
    {'mcpServers': {  # You can specify the MCP configuration file
            'time': {
                'command': 'uvx',
                'args': ['mcp-server-time', '--local-timezone=Asia/Shanghai']
            },
            "fetch": {
                "command": "uvx",
                "args": ["mcp-server-fetch"]
            }
        }
    },
  'code_interpreter',  # Built-in tools
]

# Define Agent
bot = Assistant(llm=llm_cfg, function_list=tools)

# Streaming generation
messages = [{'role': 'user', 'content': 'https://qwenlm.github.io/blog/ Introduce the latest developments of Qwen'}]
for responses in bot.run(messages=messages):
    pass
print(responses)

处理超长文本

Qwen3-Next 原生支持最长 262,144 个 token 的上下文长度。
对于输入和输出总长度显著超过该限制的对话,建议使用 RoPE 缩放技术来有效处理长文本。
我们已使用 YaRN 方法验证了模型在最长 100 万 token 上下文长度下的表现。

目前,YaRN 已得到多个推理框架的支持,例如 transformers、vllm 和 sglang。
通常,在支持的框架中启用 YaRN 有两种方式:

  • 修改模型文件: 在 config.json 文件中,添加 rope_scaling 字段:

    {
        ...,
        "rope_scaling": {
            "rope_type": "yarn",
            "factor": 4.0,
            "original_max_position_embeddings": 262144
        }
    }
  • 传入命令行参数:

    对于 vllm,可以使用

    VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --rope-scaling '{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":262144}' --max-model-len 1010000  

    对于 sglang,可以使用

    SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server ... --json-model-override-args '{"rope_scaling":{"rope_type":"yarn","factor":4.0,"original_max_position_embeddings":262144}}' --context-length 1010000

[!NOTE] 主流开源框架实现的均为静态 YaRN,即缩放因子不随输入长度变化,这可能会影响较短文本上的表现。 我们建议在需要处理长上下文时再添加 rope_scaling 配置。
同时,也建议根据实际需求调整 factor。例如,如果你的应用通常使用的上下文长度为 524,288 个 token,则最好将 factor 设置为 2.0。

长上下文表现

我们在 RULER 基准测试的 1M 版本上测试了该模型。

模型名称平均准确率4k8k16k32k64k96k128k192k256k384k512k640k768k896k1000k
Qwen3-30B-A3B-Instruct-250786.898.096.796.997.293.491.089.189.882.583.678.479.777.675.772.8
Qwen3-235B-A22B-Instruct-250792.598.597.696.997.395.894.993.994.591.092.290.987.884.886.584.5
Qwen3-Next-80B-A3B-Instruct91.898.599.098.098.797.695.096.094.093.591.786.985.581.780.380.3
  • Qwen3-Next 在启用 YaRN 的情况下进行评估。Qwen3-2507 系列模型在启用 Dual Chunk Attention 的情况下进行评估。
  • 由于评估耗时较长,我们每个长度使用 260 个样本(13 个子任务,每个子任务 20 个样本)。

最佳实践

为获得最佳性能,我们推荐以下设置:

  1. 采样参数:

    • 我们建议使用 Temperature=0.7、TopP=0.8、TopK=20 和 MinP=0。
    • 对于支持的框架,你可以将 presence_penalty 参数调整到 0 到 2 之间,以减少无限重复。不过,使用较高的值偶尔会导致语言混杂,并略微降低模型性能。
  2. 充足的输出长度:我们建议针对大多数查询使用 16,384 个 token 的输出长度,这对指令模型来说已经足够。

  3. 标准化输出格式:在进行基准测试时,我们建议使用提示词来规范模型输出。

    • 数学问题:在提示词中包含“请逐步推理,并将最终答案放入 \boxed{} 中。”
    • 选择题:在提示词中添加以下 JSON 结构以规范回答:“请在 answer 字段中仅以选项字母给出你的选择,例如 "answer": "C"。”

引用

如果你觉得我们的工作有所帮助,欢迎引用。

@misc{qwen3technicalreport,
      title={Qwen3 Technical Report}, 
      author={Qwen Team},
      year={2025},
      eprint={2505.09388},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2505.09388}, 
}

@article{qwen2.5-1m,
      title={Qwen2.5-1M Technical Report}, 
      author={An Yang and Bowen Yu and Chengyuan Li and Dayiheng Liu and Fei Huang and Haoyan Huang and Jiandong Jiang and Jianhong Tu and Jianwei Zhang and Jingren Zhou and Junyang Lin and Kai Dang and Kexin Yang and Le Yu and Mei Li and Minmin Sun and Qin Zhu and Rui Men and Tao He and Weijia Xu and Wenbiao Yin and Wenyuan Yu and Xiafei Qiu and Xingzhang Ren and Xinlong Yang and Yong Li and Zhiying Xu and Zipeng Zhang},
      journal={arXiv preprint arXiv:2501.15383},
      year={2025}
}