SparkLLM/Spark-X2.5-1.7B-Base
模型介绍
文件和版本
Pull Requests
讨论
分析

Spark-X2.5

Slack Discord YouTube dev.to Bluesky X Zhihu WeChat

[!Note] 本仓库包含以 Hugging Face Transformers 格式发布的预训练模型的模型权重和配置文件。

简介

我们正在推出 Spark-X2.5-4B 和 Spark-X2.5-1.7B,这是两款紧凑、通用的语言模型,旨在让能力更强的 AI 更加实用、高效且易于获取。它们在对话、写作、翻译、推理、编码、工具调用和智能体工作流等广泛日常任务中表现出色,并在同尺寸开源模型中取得领先结果。Spark-X2.5 将高效架构与原生最高 100 万 token 上下文窗口相结合,并支持超过 200 种语言。

技术亮点:

  • 高效架构与原生 100 万 token 上下文:模型采用混合注意力架构,将一个完整注意力层与三个滑动窗口注意力层相结合。该设计在原生支持最高 100 万 token 上下文窗口的同时,显著降低了长上下文模型通常带来的计算开销。
  • 强大的编码与智能体能力:模型与主流智能体框架深度集成,包括 Codex、Claude Code、OpenClaw 和 Hermes。在同尺寸模型中,它们在编码、智能体工作流、推理和指令跟随任务中展现出领先的性能。
  • 广泛的硬件与软件兼容性:模型支持多种硬件平台,包括 NVIDIA、Huawei、Hygon、HOUMO.AI 等。它们兼容 vLLM、SGLang、llama.cpp 等主流推理框架,并可通过 Ollama 和 LM Studio 等平台快速部署。模型还可使用 LLaMA-Factory 等主流微调框架进行定制。在多类硬件平台上,与同尺寸模型相比,它们在 TTFT、TOPT 和整体推理效率方面表现更优。
  • 先进的训练算法:模型在 Huawei Ascend 集群上训练。大规模强化学习和 MOPD 等后训练技术显著提升了其推理、编码、智能体和指令跟随能力。

模型概述

在智能体任务中,兼顾性能、推理速度与缓存开销,一直是制约模型表现的关键瓶颈。Spark-X2.5 系统性地整合并优化成熟的注意力技术,将滑动窗口注意力(SWA)与混合全注意力架构相结合。这一方案兼顾两种机制的优势,避免依赖单一结构带来的局限,在性能、推理效率与 KV-cache 规模之间实现有效平衡,从而提升其在真实部署场景中的实用性和有效性。

Spark-X2.5 hybrid architecture

微调

我们建议使用 Llama-Factory 对模型进行微调。

授权

Spark-X2.5 模型系列基于 Apache 2.0 License 授权。

引用

如果您觉得我们的工作有所帮助,欢迎引用。

@misc{sparkx2.5,
    title  = {Spark-X2.5 4B&1.7B: Pushing the Limits of Agentic Capabilities in On-Device Models},
    author = {SparkLLM Team},
    year   = {2026}
}