SparkLLM/Spark-X2.5-4B-GGUF
模型介绍
文件和版本
Pull Requests
讨论
分析

Spark-X2.5-4B-GGUF

[!NOTE] 本仓库提供 Spark-X2.5-4B 的 BF16 GGUF 转换版本。

Spark-X2.5 是一款紧凑通用的语言模型,适用于对话、写作、翻译、推理、编程、工具调用和智能体工作流。它采用混合注意力架构,原生支持最长 100 万 tokens 的上下文长度,并覆盖 200 多种语言。有关其架构、训练方法、基准测试结果、微调和引用信息,请参阅 Spark-X2.5-4B。

本地部署

该 GGUF 文件可通过 Ollama 和 LM Studio 进行本地推理。Spark-X2.5 的支持由 XHToken/llama.cpp 提供,因此下方的快速入门使用此兼容实现。

Ollama 快速入门

构建

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
git clone https://github.com/ollama/ollama.git ollama-spark
cd ollama-spark
export OLLAMA_LLAMA_CPP_SOURCE="$(cd ../llama.cpp-spark && pwd)"
cmake -S . -B build
cmake --build build --parallel 8

导入 GGUF

请将下面的模型路径替换为已下载的 GGUF 文件绝对路径:

printf 'FROM /absolute/path/to/Spark-X2.5-4B.gguf\n' > ./Modelfile.spark

创建与运行

在第一个终端中启动 Ollama 服务器:

./ollama serve

在同一 ollama-spark 目录中打开第二个终端:

./ollama create Spark-X2.5-4B -f ./Modelfile.spark
./ollama run Spark-X2.5-4B --think=false

--think=false 用于禁用思考模式,以获得更快、更直接的响应。

LM Studio 快速入门

构建兼容的 llama.cpp 运行时

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
cd llama.cpp-spark
cmake -S . -B build
cmake --build build --parallel 8

配置 LM Studio

  1. 关闭 LM Studio。

  2. 备份所选的 LM Studio 运行时目录:

    <LM_STUDIO_HOME>/extensions/backends/<selected-runtime>/
  3. 将 llama.cpp-spark 构建输出复制到所选的运行时目录中,替换现有的运行时文件。

  4. 将 Spark-X2.5-4B.gguf 放置到以下路径:

    <LM_STUDIO_HOME>/models/<org>/<name>/

Apple Silicon 上的运行时目录示例:

./build/bin/* -> ~/.lmstudio/extensions/backends/llama.cpp-mac-arm64-apple-metal-advsimd-<version>/

运行

打开 LM Studio,在 My Models 下选择模型,点击 Load,然后开始新的聊天。

你也可以使用 lms CLI:

lms ls
lms load <model>
lms chat <model>

许可证

本内容在 Apache License 2.0 许可下发布。