SparkLLM/Spark-X2.5-4B-Base
模型介绍
文件和版本
Pull Requests
讨论
分析

Spark-X2.5

Slack Discord YouTube dev.to Bluesky X Zhihu WeChat

[!Note] 本仓库包含 Hugging Face Transformers 格式的预训练模型权重和配置文件。

简介

我们推出 Spark-X2.5-4B 和 Spark-X2.5-1.7B 两款紧凑型通用语言模型,旨在让更强大的 AI 更实用、更高效、更易获取。这两款模型在广泛日常任务中表现强劲,包括对话、写作、翻译、推理、编码、工具调用和智能体工作流,并在同等规模的开源模型中取得领先结果。Spark-X2.5 将注重效率的架构与最高可达 1M token 的原生上下文窗口相结合,并支持 200 多种语言。

技术亮点:

  • 高效架构与原生 1M token 上下文:模型采用混合注意力架构,将一层全注意力层与三层滑动窗口注意力层相结合。该设计在原生支持最高 1M token 上下文窗口的同时,显著降低长上下文模型通常伴随的计算开销。
  • 强大的编码与智能体能力:模型与流行的智能体运行框架深度集成,包括 Codex、Claude Code、OpenClaw 和 Hermes。在同等规模模型中,它在日常编码、智能体工作流、推理和指令遵循任务上均达到最先进水平。
  • 广泛的硬件与软件兼容性:模型支持多种硬件平台,包括 NVIDIA、Huawei、Hygon、HOUMO.AI 等。它们兼容 vLLM、SGLang、llama.cpp 等主流推理框架,并可通过 Ollama、LM Studio 等平台快速部署。模型还可使用 LLaMA-Factory 等流行微调框架进行定制。在多个硬件平台上,与同等规模模型相比,它们在 TTFT、TOPT 和整体推理效率方面表现更优。
  • 先进训练算法:模型在 Huawei Ascend 集群上完成训练。大规模强化学习和 MOPD 等后训练技术显著提升了其推理、编码、智能体和指令遵循能力。

模型概述

在智能体任务中,性能、推理速度与缓存占用之间的平衡长期以来一直是制约模型性能的关键瓶颈。Spark-X2.5 系统化地整合并优化了成熟的注意力技术,将滑动窗口注意力(SWA)与混合全注意力架构相结合。这种方式兼具两种机制的优势,同时避免依赖单一结构带来的局限,从而在性能、推理效率与 KV-Cache 大小之间实现有效平衡,进一步提升其在真实部署场景中的实用性与有效性。

Spark-X2.5 混合架构

微调

建议使用 Llama-Factory 对模型进行微调。

许可证

Spark-X2.5 模型系列采用 Apache 2.0 License 授权。

引用

如果你觉得我们的工作有帮助,欢迎引用。

@misc{sparkx2.5,
    title  = {Spark-X2.5 4B&1.7B: Pushing the Limits of Agentic Capabilities in On-Device Models},
    author = {SparkLLM Team},
    year   = {2026}
}