[!NOTE] 本仓库提供 Spark-X2.5-4B 的 BF16 GGUF 转换版本。
Spark-X2.5 是一款紧凑通用的语言模型,适用于对话、写作、翻译、推理、编程、工具调用和智能体工作流。它采用混合注意力架构,原生支持最长 100 万 tokens 的上下文长度,并覆盖 200 多种语言。有关其架构、训练方法、基准测试结果、微调和引用信息,请参阅 Spark-X2.5-4B。
该 GGUF 文件可通过 Ollama 和 LM Studio 进行本地推理。Spark-X2.5 的支持由 XHToken/llama.cpp 提供,因此下方的快速入门使用此兼容实现。
git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
git clone https://github.com/ollama/ollama.git ollama-spark
cd ollama-spark
export OLLAMA_LLAMA_CPP_SOURCE="$(cd ../llama.cpp-spark && pwd)"
cmake -S . -B build
cmake --build build --parallel 8请将下面的模型路径替换为已下载的 GGUF 文件绝对路径:
printf 'FROM /absolute/path/to/Spark-X2.5-4B.gguf\n' > ./Modelfile.spark在第一个终端中启动 Ollama 服务器:
./ollama serve在同一 ollama-spark 目录中打开第二个终端:
./ollama create Spark-X2.5-4B -f ./Modelfile.spark
./ollama run Spark-X2.5-4B --think=false--think=false 用于禁用思考模式,以获得更快、更直接的响应。
git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
cd llama.cpp-spark
cmake -S . -B build
cmake --build build --parallel 8关闭 LM Studio。
备份所选的 LM Studio 运行时目录:
<LM_STUDIO_HOME>/extensions/backends/<selected-runtime>/将 llama.cpp-spark 构建输出复制到所选的运行时目录中,替换现有的运行时文件。
将 Spark-X2.5-4B.gguf 放置到以下路径:
<LM_STUDIO_HOME>/models/<org>/<name>/Apple Silicon 上的运行时目录示例:
./build/bin/* -> ~/.lmstudio/extensions/backends/llama.cpp-mac-arm64-apple-metal-advsimd-<version>/打开 LM Studio,在 My Models 下选择模型,点击 Load,然后开始新的聊天。
你也可以使用 lms CLI:
lms ls
lms load <model>
lms chat <model>本内容在 Apache License 2.0 许可下发布。