HauhauCS FastMTP:文档生成速度最高提升 3.02 倍,推理速度最高提升 1.93 倍(相较于非 MTP 版本)——同时文档生成速度比标准内置 MTP 高出 35.2%,推理速度高出 21.1%。
加入 Discord 获取更新、路线图、项目动态,或单纯交流闲聊。
Qwen3.8-27B 无审查版,由 HauhauCS 出品 0/465 拒绝率*。
此为 激进变体:直接给出答案,无拒绝行为,面对困难提示词时几乎不做铺垫。
每个文本 GGUF 均保留 Qwen3.8 原生 NextN 头,本版本新增 HauhauCS FastMTP:一个特定的加速边车文件,已在完整量化系列中以最大原生上下文完成验证。 视觉能力通过独立的 BF16 投影器提供。
Hugging Face 的硬件兼容性组件可能无法识别 K_P 量化格式。 若文件显示缺失,请点击 查看变体 或打开 文件与版本。
未对数据集或预期能力做任何更改。本版本在保留 Qwen3.8-27B 的文本、推理、智能体、图像和视频能力的同时,应用了 HauhauCS 激进无审查配置。
当你明确希望模型直接给出答案、而不先自我说服地进入合规模式时,请选择激进版。对于可靠性要求较高、尤其是长上下文的智能体工作,如果有平衡版可用,通常以平衡版作为更稳妥的默认选择。
| 文件 | 量化 | BPW | 大小 |
|---|---|---|---|
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q8_K_P.gguf | Q8_K_P | 9.21 | 31.46 GB |
| — | Q8_0 | 8.50 | — |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q6_K_P.gguf | Q6_K_P | 7.59 | 25.92 GB |
| — | Q6_K | 6.60 | — |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q5_K_P.gguf | Q5_K_P | 5.92 | 20.22 GB |
| — | Q5_K_M | 5.70 | — |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf | Q4_K_P | 5.25 | 17.92 GB |
| — | Q4_K_M | 4.88 | — |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ4_XS.gguf | IQ4_XS | 4.60 | 15.71 GB |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q3_K_P.gguf | Q3_K_P | 3.93 | 13.44 GB |
| — | Q3_K_M | 3.90 | — |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ3_M.gguf | IQ3_M | 3.74 | 12.79 GB |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ3_XS.gguf | IQ3_XS | 3.56 | 12.18 GB |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q2_K_P.gguf | Q2_K_P | 3.12 | 10.68 GB |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ2_M.gguf | IQ2_M | 3.02 | 10.32 GB |
| mmproj-Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-BF16.gguf | 视觉投影器 | — | 931 MB |
| Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.gguf | HauhauCS FastMTP | — | 903 MB |
BPW 为整个文本模型(含其内置 MTP 张量)编码张量负载的平均值,四舍五入保留两位小数。投影器和 FastMTP 边车文件兼容所有文本量化版本;仅在使用图像或视频输入时才需要下载投影器。
K_P(“Perfect”)量化是 HauhauCS 的自定义量化方案,利用模型专属分析,在最关键的部位选择性保留质量。每个模型都拥有为其量身定制的优化量化配置。
与基础量化相比,K_P 量化等效于将质量提升一到两个量化等级,而文件体积仅增加约 5–15%。这些文件仍然是标准 GGUF 格式,可直接在 llama.cpp、LM Studio 以及其他兼容 GGUF 的运行时中使用,无需任何特殊编译或插件。
注意: K_P 量化在 LM Studio 的量化列中可能显示为 ?。这仅是显示问题——模型加载和运行均正常。
HauhauCS FastMTP 是为这个特定 Aggressive 版本量身定制的加速配置,包含紧凑的 32K 草稿侧车模型,以及针对 TG、接受率、最大原生上下文和 VRAM 分别验证的逐量化等级服务配置。
它实现了相比非 MTP 最高 3.02 倍的文档 TG 和 1.93 倍的推理 TG,同时相比标准嵌入式 MTP 配置,文档 TG 提升最高 35.2%,推理 TG 提升最高 21.1%。 未修改的完整目标模型会验证每一个草稿 token,因此 FastMTP 在加速生成的同时,不会替换目标模型或改变其输出结果。其构建和选择方法论为 HauhauCS 版本独有。
基准测试阶梯:
| 对比项 | 文档 TG | 推理 TG | 范围 |
|---|---|---|---|
| 标准嵌入式 MTP vs 禁用 MTP | 2.23 倍(+123.4%) | 1.60 倍(+59.6%) | 最终 Q8_K_P,深度 2 |
| HauhauCS FastMTP 配置 vs 标准嵌入式 MTP | +35.2% | +21.1% | 最终 Q8_K_P,深度 3 vs 深度 2 |
| HauhauCS FastMTP vs 同深度嵌入式 MTP | +11.1% | +18.2% | 最终 Q8_K_P,深度 3 |
| HauhauCS FastMTP vs 禁用 MTP | 3.02 倍(+202.0%) | 1.93 倍(+93.3%) | 最终 Q8_K_P 服务 |
以上结果在每条隔离通道上使用单块 RTX PRO 6000 Blackwell 96 GB 显卡测得,配置为 204800 上下文、完整 CUDA 卸载、--no-mmap 以及官方推理采样器。FastMTP 加速的是 TG;PP 同时列出以供完整服务对比。
存在两条加速路径:
--spec-type draft-mtp 即可。Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.gguf 以及下述 HauhauCS 运行时补丁配合使用。紧凑版草稿使用标准 GGUF d2t 令牌映射,外加一个精简的 Qwen3.8 运行时消费者。只需构建一次即可。以下示例使用 CUDA;若使用 ROCm/HIP 或 Vulkan,请将 -DGGML_CUDA=ON 替换为 -DGGML_HIP=ON 或 -DGGML_VULKAN=ON。仅使用 CPU 时,省略后端标志即可。
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
git checkout 4df29be4f4c3673f428170fda944a5b19f743bb8
curl -L -o HauhauCS-FastMTP-llama.cpp.patch \
https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-FastMTP-llama.cpp.patch
git apply --check HauhauCS-FastMTP-llama.cpp.patch
git apply HauhauCS-FastMTP-llama.cpp.patch
cmake -S . -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j"$(nproc)"如果草稿加载时提示 expected 5120, 248320, got 5120, 32768,说明 FastMTP 副车文件正确,但可执行文件未打补丁。请从当前检出目录启动新构建的 ./build/bin/llama-server。
然后,使用同一个共享的 FastMTP 副车文件来服务任意目标量化模型:
MODEL=Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf
DRAFT=Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.gguf
DEPTH=3
CUDA_VISIBLE_DEVICES=0 ./build/bin/llama-server \
--model "$MODEL" \
--spec-draft-model "$DRAFT" \
--spec-draft-ngl all \
--spec-type draft-mtp \
--spec-draft-n-max "$DEPTH" \
--spec-draft-p-min 0 \
--ctx-size 204800 \
--parallel 1 \
--batch-size 2048 \
--ubatch-size 512 \
--n-gpu-layers all \
--split-mode none \
--flash-attn on \
--no-mmap \
--temp 1.0 \
--top-k 20 \
--top-p 0.95 \
--min-p 0 \
--presence-penalty 0 \
--repeat-penalty 1.0 \
--jinja \
--reasoning on \
--reasoning-effort xhigh \
--reasoning-preserve \
--reasoning-format deepseek \
--host 127.0.0.1 \
--port 8080未缓存 9.8K token 文档测试场景的三次运行中位数,以及推理场景的三次均值。每个 FastMTP 结果均复现了对应嵌入式 MTP 输出的哈希值。
| 量化等级 | 深度 | PP tok/s | 文档 TG | 推理 TG | 对比嵌入式 n2,文档 / 推理 | 对比关闭 MTP,文档 / 推理 |
|---|---|---|---|---|---|---|
| Q2_K_P | 3 | 3351.29 | 213.95 | 145.09 | +11.6% / +1.7% | 2.27x / 1.48x |
| Q3_K_P | 3 | 3317.16 | 216.15 | 137.99 | +20.5% / +8.8% | 2.54x / 1.56x |
| Q4_K_P | 3 | 3204.98 | 187.26 | 123.52 | +18.0% / +2.3% | 2.67x / 1.71x |
| Q5_K_P | 3 | 2842.05 | 168.29 | 110.50 | +17.8% / +4.6% | 2.61x / 1.66x |
| Q6_K_P | 3 | 3081.90 | 156.57 | 103.51 | +26.5% / +13.8% | 2.95x / 1.91x |
| Q8_K_P | 3 | 3285.86 | 138.18 | 90.07 | +35.2% / +21.1% | 3.02x / 1.93x |
| IQ2_M | 3 | 3050.94 | 219.19 | 135.00 | +13.8% / +0.4% | 2.33x / 1.39x |
| IQ3_M | 3 | 3269.27 | 204.98 | 128.45 | +21.5% / +7.9% | 2.40x / 1.45x |
| IQ3_XS | 3 | 3165.75 | 210.64 | 138.34 | +19.1% / +5.9% | 2.38x / 1.51x |
| IQ4_XS | 3 | 3445.30 | 211.09 | 135.77 | +21.7% / +9.3% | 2.68x / 1.66x |
全窗口门控使用了最终清理后的 Q3_K_P 和 FastMTP 文件:190,000 个未缓存提示词 token 加上 64 个生成 token,以 1613.81 PP tok/s 和 131.81 TG tok/s 的速度完成,草稿接受率达 92.0%,且在配置的最大原生上下文内无任何截断。
最终公开文件在配置的最大 token 上下文下的单次运行参考结果,采用完整 CUDA 卸载、--no-mmap、官方推理采样器及嵌入式 MTP。测试负载使用未缓存的 9.8K token 文档续写提示词,后跟 512 个生成 token。
| 量化等级 | PP tok/s | TG tok/s |
|---|---|---|
| Q2_K_P | 1959.14 | 121.88 |
| Q3_K_P | 1944.73 | 112.76 |
| Q4_K_P | 1860.34 | 92.60 |
| Q5_K_P | 1737.51 | 83.25 |
| Q6_K_P | 1747.60 | 72.89 |
| Q8_K_P | 1827.29 | 59.00 |
| IQ2_M | 1884.83 | 121.25 |
| IQ3_M | 1867.48 | 108.45 |
| IQ3_XS | 1880.59 | 111.77 |
| IQ4_XS | 1978.46 | 104.25 |
启用 HauhauCS FastMTP 后,最终 Q3_K_P 在同一块 Ada 上达到了 138.37 文档 TG 和 87.95 推理 TG——分别比固定的 Unsloth Q3 对照快 23.5% 和 3.9%。
思考模式(默认):
temperature=1.0top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0reasoning_effort=xhigh 以获得最深度的推理指令 / 非思考模式:
temperature=0.7top_p=0.80top_k=20min_p=0.0presence_penalty=1.5repetition_penalty=1.0enable_thinking=falseQwen3.8 支持 xhigh、medium 和 low 三档推理强度。在官方模型契约中,思考模式与保留推理默认开启。
重要提示:
--jinja 启用内置聊天模板。262144。如果您的 llama.cpp 构建版本无法识别推理或 MTP 相关参数,请进行更新。较旧的构建版本可能仍能加载 GGUF,但无法完整支持 Qwen3.8 的推理服务路径。
Qwen3.8 默认启用思考模式。当您希望获得更简短、更快速的直接回答时,可将其关闭。
以 llama-server 为例,对所有请求的默认设置:
--chat-template-kwargs '{"enable_thinking":false}'通过兼容OpenAI的API调用示例:
{
"model": "qwen3.8-27b-aggressive-q3",
"messages": [{"role": "user", "content": "..."}],
"chat_template_kwargs": {"enable_thinking": false}
}多轮智能体示例,使用以下方式保留先前的推理上下文:
{
"chat_template_kwargs": {"preserve_thinking": true}
}?每个 GGUF 文件均由已签名的 HauhauCS 发布清单覆盖。重命名后,精确的 SHA-256 值可用于识别逐字节一致的镜像副本;标准张量指纹可持续用于识别经仅元数据重写后的 HauhauCS 张量。
FastMTP sidecar 文件的确切 SHA-256 为 115e618e1f73cb50817ed5856f0551c6bf9c3d94df96f440eaca78dc63b8968b;其标准张量指纹为 49e248e799f169b6ccc6a8127b9300a95f06cf3d96a8353266f5d457e81d1c87。公钥 DER 指纹为 f7be4a2335582ab7b2e393ca1c40ce70e483f1492c0f57b8c6e05d8a7223833c。
请下载 HauhauCS-RELEASE-MANIFEST.json 及其签名文件、FastMTP-PROVENANCE.json 及其签名文件、以及 HauhauCS-FastMTP-Ed25519-PUBLIC.pem,随后进行验证:
openssl pkeyutl -verify -rawin -pubin \
-inkey HauhauCS-FastMTP-Ed25519-PUBLIC.pem \
-in FastMTP-PROVENANCE.json \
-sigfile FastMTP-PROVENANCE.json.sig
openssl pkeyutl -verify -rawin -pubin \
-inkey HauhauCS-FastMTP-Ed25519-PUBLIC.pem \
-in HauhauCS-RELEASE-MANIFEST.json \
-sigfile HauhauCS-RELEASE-MANIFEST.json.sigQwen3.8-27B 由 Qwen 团队根据 Apache 2.0 许可证发布。本量化版 Aggressive 变体同样遵循该许可证。