SparkLLM/Spark-X2.5-1.7B-GGUF
模型介绍
文件和版本
Pull Requests
讨论
分析

Spark-X2.5-1.7B-GGUF

[!NOTE] 本仓库提供 Spark-X2.5-1.7B 的 BF16 GGUF 转换版本。

Spark-X2.5 是一款面向对话、写作、翻译、推理、编码、工具调用和智能体工作流的紧凑型通用语言模型。它采用混合注意力架构,支持最长 1M tokens 的原生上下文长度,并覆盖 200 多种语言。有关其架构、训练方法、基准测试结果、微调方法及引用信息,请参阅 Spark-X2.5-1.7B。

本地部署

GGUF 文件可配合 Ollama 和 LM Studio 用于本地推理。Spark-X2.5 的支持由 XHToken/llama.cpp 提供,因此下方的快速开始均基于该兼容实现。

Ollama 快速开始

构建

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
git clone https://github.com/ollama/ollama.git ollama-spark
cd ollama-spark
export OLLAMA_LLAMA_CPP_SOURCE="$(cd ../llama.cpp-spark && pwd)"
cmake -S . -B build
cmake --build build --parallel 8

导入 GGUF

将下方的模型路径替换为已下载 GGUF 文件的绝对路径:

printf 'FROM /absolute/path/to/Spark-X2.5-1.7B.gguf\n' > ./Modelfile.spark

创建和运行

在第一个终端中启动 Ollama 服务器:

./ollama serve

在同一 ollama-spark 目录中打开第二个终端:

./ollama create Spark-X2.5-1.7B -f ./Modelfile.spark
./ollama run Spark-X2.5-1.7B --think=false

--think=false 用于禁用思考模式,以获得更快、更直接的响应。

LM Studio 快速入门

构建兼容的 llama.cpp 运行时

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
cd llama.cpp-spark
cmake -S . -B build
cmake --build build --parallel 8

配置 LM Studio

  1. 关闭 LM Studio。

  2. 备份所选的 LM Studio 运行时目录:

    <LM_STUDIO_HOME>/extensions/backends/<selected-runtime>/
  3. 将 llama.cpp-spark 的构建产物复制到所选运行时目录中,替换现有的运行时文件。

  4. 将 Spark-X2.5-1.7B.gguf 放置到:

    <LM_STUDIO_HOME>/models/<org>/<name>/

在 Apple Silicon 上的运行时目录示例:

./build/bin/* -> ~/.lmstudio/extensions/backends/llama.cpp-mac-arm64-apple-metal-advsimd-<version>/

运行

打开 LM Studio,在 My Models 下选择模型,点击 Load,并开始新的对话。

你也可以使用 lms CLI:

lms ls
lms load <model>
lms chat <model>

许可证

基于 Apache License 2.0 发布。