[!NOTE] 本仓库提供 Spark-X2.5-1.7B 的 BF16 GGUF 转换版本。
Spark-X2.5 是一款面向对话、写作、翻译、推理、编码、工具调用和智能体工作流的紧凑型通用语言模型。它采用混合注意力架构,支持最长 1M tokens 的原生上下文长度,并覆盖 200 多种语言。有关其架构、训练方法、基准测试结果、微调方法及引用信息,请参阅 Spark-X2.5-1.7B。
GGUF 文件可配合 Ollama 和 LM Studio 用于本地推理。Spark-X2.5 的支持由 XHToken/llama.cpp 提供,因此下方的快速开始均基于该兼容实现。
git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
git clone https://github.com/ollama/ollama.git ollama-spark
cd ollama-spark
export OLLAMA_LLAMA_CPP_SOURCE="$(cd ../llama.cpp-spark && pwd)"
cmake -S . -B build
cmake --build build --parallel 8将下方的模型路径替换为已下载 GGUF 文件的绝对路径:
printf 'FROM /absolute/path/to/Spark-X2.5-1.7B.gguf\n' > ./Modelfile.spark在第一个终端中启动 Ollama 服务器:
./ollama serve在同一 ollama-spark 目录中打开第二个终端:
./ollama create Spark-X2.5-1.7B -f ./Modelfile.spark
./ollama run Spark-X2.5-1.7B --think=false--think=false 用于禁用思考模式,以获得更快、更直接的响应。
git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
cd llama.cpp-spark
cmake -S . -B build
cmake --build build --parallel 8关闭 LM Studio。
备份所选的 LM Studio 运行时目录:
<LM_STUDIO_HOME>/extensions/backends/<selected-runtime>/将 llama.cpp-spark 的构建产物复制到所选运行时目录中,替换现有的运行时文件。
将 Spark-X2.5-1.7B.gguf 放置到:
<LM_STUDIO_HOME>/models/<org>/<name>/在 Apple Silicon 上的运行时目录示例:
./build/bin/* -> ~/.lmstudio/extensions/backends/llama.cpp-mac-arm64-apple-metal-advsimd-<version>/打开 LM Studio,在 My Models 下选择模型,点击 Load,并开始新的对话。
你也可以使用 lms CLI:
lms ls
lms load <model>
lms chat <model>基于 Apache License 2.0 发布。