HuggingFace镜像/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF
模型介绍
文件和版本
分析

Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP

HauhauCS FastMTP:文档生成速度最高提升 3.02 倍,推理速度最高提升 1.93 倍(相较于非 MTP 版本)——同时文档生成速度比标准内置 MTP 高出 35.2%,推理速度高出 21.1%。

加入 Discord 获取更新、路线图、项目动态,或单纯交流闲聊。

Qwen3.8-27B 无审查版,由 HauhauCS 出品 0/465 拒绝率*。

此为 激进变体:直接给出答案,无拒绝行为,面对困难提示词时几乎不做铺垫。

每个文本 GGUF 均保留 Qwen3.8 原生 NextN 头,本版本新增 HauhauCS FastMTP:一个特定的加速边车文件,已在完整量化系列中以最大原生上下文完成验证。 视觉能力通过独立的 BF16 投影器提供。

Hugging Face 的硬件兼容性组件可能无法识别 K_P 量化格式。 若文件显示缺失,请点击 查看变体 或打开 文件与版本。

简介

未对数据集或预期能力做任何更改。本版本在保留 Qwen3.8-27B 的文本、推理、智能体、图像和视频能力的同时,应用了 HauhauCS 激进无审查配置。

当你明确希望模型直接给出答案、而不先自我说服地进入合规模式时,请选择激进版。对于可靠性要求较高、尤其是长上下文的智能体工作,如果有平衡版可用,通常以平衡版作为更稳妥的默认选择。

下载

文件量化BPW大小
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q8_K_P.ggufQ8_K_P9.2131.46 GB
—Q8_08.50—
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q6_K_P.ggufQ6_K_P7.5925.92 GB
—Q6_K6.60—
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q5_K_P.ggufQ5_K_P5.9220.22 GB
—Q5_K_M5.70—
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.ggufQ4_K_P5.2517.92 GB
—Q4_K_M4.88—
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ4_XS.ggufIQ4_XS4.6015.71 GB
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q3_K_P.ggufQ3_K_P3.9313.44 GB
—Q3_K_M3.90—
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ3_M.ggufIQ3_M3.7412.79 GB
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ3_XS.ggufIQ3_XS3.5612.18 GB
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q2_K_P.ggufQ2_K_P3.1210.68 GB
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-IQ2_M.ggufIQ2_M3.0210.32 GB
mmproj-Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-BF16.gguf视觉投影器—931 MB
Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.ggufHauhauCS FastMTP—903 MB

BPW 为整个文本模型(含其内置 MTP 张量)编码张量负载的平均值,四舍五入保留两位小数。投影器和 FastMTP 边车文件兼容所有文本量化版本;仅在使用图像或视频输入时才需要下载投影器。

什么是 K_P 量化?

K_P(“Perfect”)量化是 HauhauCS 的自定义量化方案,利用模型专属分析,在最关键的部位选择性保留质量。每个模型都拥有为其量身定制的优化量化配置。

与基础量化相比,K_P 量化等效于将质量提升一到两个量化等级,而文件体积仅增加约 5–15%。这些文件仍然是标准 GGUF 格式,可直接在 llama.cpp、LM Studio 以及其他兼容 GGUF 的运行时中使用,无需任何特殊编译或插件。

注意: K_P 量化在 LM Studio 的量化列中可能显示为 ?。这仅是显示问题——模型加载和运行均正常。

规格参数

  • 密集 27B 因果语言模型,带视觉编码器
  • 64 层语言模型层
  • 隐藏层大小 5,120;FFN 大小 17,408
  • 248,320 token 填充词汇表
  • 48 层 Gated DeltaNet 层和 16 层门控注意力层
  • 保留原生嵌入式 MTP/NextN,外加 HauhauCS FastMTP 32K 加速配置
  • 262,144 token 原生上下文;可通过框架特定配置扩展至 1,000,000
  • 原生文本、图像和视频理解能力
  • 基于 Qwen/Qwen3.8-27B

什么是 HauhauCS FastMTP?

HauhauCS FastMTP 是为这个特定 Aggressive 版本量身定制的加速配置,包含紧凑的 32K 草稿侧车模型,以及针对 TG、接受率、最大原生上下文和 VRAM 分别验证的逐量化等级服务配置。

它实现了相比非 MTP 最高 3.02 倍的文档 TG 和 1.93 倍的推理 TG,同时相比标准嵌入式 MTP 配置,文档 TG 提升最高 35.2%,推理 TG 提升最高 21.1%。 未修改的完整目标模型会验证每一个草稿 token,因此 FastMTP 在加速生成的同时,不会替换目标模型或改变其输出结果。其构建和选择方法论为 HauhauCS 版本独有。

基准测试阶梯:

对比项文档 TG推理 TG范围
标准嵌入式 MTP vs 禁用 MTP2.23 倍(+123.4%)1.60 倍(+59.6%)最终 Q8_K_P,深度 2
HauhauCS FastMTP 配置 vs 标准嵌入式 MTP+35.2%+21.1%最终 Q8_K_P,深度 3 vs 深度 2
HauhauCS FastMTP vs 同深度嵌入式 MTP+11.1%+18.2%最终 Q8_K_P,深度 3
HauhauCS FastMTP vs 禁用 MTP3.02 倍(+202.0%)1.93 倍(+93.3%)最终 Q8_K_P 服务

以上结果在每条隔离通道上使用单块 RTX PRO 6000 Blackwell 96 GB 显卡测得,配置为 204800 上下文、完整 CUDA 卸载、--no-mmap 以及官方推理采样器。FastMTP 加速的是 TG;PP 同时列出以供完整服务对比。

存在两条加速路径:

  • 嵌入式 MTP: 单独使用任意目标 GGUF,在当前上游 llama.cpp 构建中指定 --spec-type draft-mtp 即可。
  • HauhauCS FastMTP: 将同一目标模型与 Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.gguf 以及下述 HauhauCS 运行时补丁配合使用。

运行 HauhauCS FastMTP

紧凑版草稿使用标准 GGUF d2t 令牌映射,外加一个精简的 Qwen3.8 运行时消费者。只需构建一次即可。以下示例使用 CUDA;若使用 ROCm/HIP 或 Vulkan,请将 -DGGML_CUDA=ON 替换为 -DGGML_HIP=ON 或 -DGGML_VULKAN=ON。仅使用 CPU 时,省略后端标志即可。

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
git checkout 4df29be4f4c3673f428170fda944a5b19f743bb8

curl -L -o HauhauCS-FastMTP-llama.cpp.patch \
  https://huggingface.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF/resolve/main/HauhauCS-FastMTP-llama.cpp.patch
git apply --check HauhauCS-FastMTP-llama.cpp.patch
git apply HauhauCS-FastMTP-llama.cpp.patch

cmake -S . -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j"$(nproc)"

如果草稿加载时提示 expected 5120, 248320, got 5120, 32768,说明 FastMTP 副车文件正确,但可执行文件未打补丁。请从当前检出目录启动新构建的 ./build/bin/llama-server。

然后,使用同一个共享的 FastMTP 副车文件来服务任意目标量化模型:

MODEL=Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf
DRAFT=Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-FastMTP-32K.gguf
DEPTH=3

CUDA_VISIBLE_DEVICES=0 ./build/bin/llama-server \
  --model "$MODEL" \
  --spec-draft-model "$DRAFT" \
  --spec-draft-ngl all \
  --spec-type draft-mtp \
  --spec-draft-n-max "$DEPTH" \
  --spec-draft-p-min 0 \
  --ctx-size 204800 \
  --parallel 1 \
  --batch-size 2048 \
  --ubatch-size 512 \
  --n-gpu-layers all \
  --split-mode none \
  --flash-attn on \
  --no-mmap \
  --temp 1.0 \
  --top-k 20 \
  --top-p 0.95 \
  --min-p 0 \
  --presence-penalty 0 \
  --repeat-penalty 1.0 \
  --jinja \
  --reasoning on \
  --reasoning-effort xhigh \
  --reasoning-preserve \
  --reasoning-format deepseek \
  --host 127.0.0.1 \
  --port 8080

RTX PRO 6000 Blackwell FastMTP 参考速度

未缓存 9.8K token 文档测试场景的三次运行中位数,以及推理场景的三次均值。每个 FastMTP 结果均复现了对应嵌入式 MTP 输出的哈希值。

量化等级深度PP tok/s文档 TG推理 TG对比嵌入式 n2,文档 / 推理对比关闭 MTP,文档 / 推理
Q2_K_P33351.29213.95145.09+11.6% / +1.7%2.27x / 1.48x
Q3_K_P33317.16216.15137.99+20.5% / +8.8%2.54x / 1.56x
Q4_K_P33204.98187.26123.52+18.0% / +2.3%2.67x / 1.71x
Q5_K_P32842.05168.29110.50+17.8% / +4.6%2.61x / 1.66x
Q6_K_P33081.90156.57103.51+26.5% / +13.8%2.95x / 1.91x
Q8_K_P33285.86138.1890.07+35.2% / +21.1%3.02x / 1.93x
IQ2_M33050.94219.19135.00+13.8% / +0.4%2.33x / 1.39x
IQ3_M33269.27204.98128.45+21.5% / +7.9%2.40x / 1.45x
IQ3_XS33165.75210.64138.34+19.1% / +5.9%2.38x / 1.51x
IQ4_XS33445.30211.09135.77+21.7% / +9.3%2.68x / 1.66x

全窗口门控使用了最终清理后的 Q3_K_P 和 FastMTP 文件:190,000 个未缓存提示词 token 加上 64 个生成 token,以 1613.81 PP tok/s 和 131.81 TG tok/s 的速度完成,草稿接受率达 92.0%,且在配置的最大原生上下文内无任何截断。

RTX 6000 Ada 嵌入式 MTP 参考速度

最终公开文件在配置的最大 token 上下文下的单次运行参考结果,采用完整 CUDA 卸载、--no-mmap、官方推理采样器及嵌入式 MTP。测试负载使用未缓存的 9.8K token 文档续写提示词,后跟 512 个生成 token。

量化等级PP tok/sTG tok/s
Q2_K_P1959.14121.88
Q3_K_P1944.73112.76
Q4_K_P1860.3492.60
Q5_K_P1737.5183.25
Q6_K_P1747.6072.89
Q8_K_P1827.2959.00
IQ2_M1884.83121.25
IQ3_M1867.48108.45
IQ3_XS1880.59111.77
IQ4_XS1978.46104.25

启用 HauhauCS FastMTP 后,最终 Q3_K_P 在同一块 Ada 上达到了 138.37 文档 TG 和 87.95 推理 TG——分别比固定的 Unsloth Q3 对照快 23.5% 和 3.9%。

推荐设置

参考官方 Qwen3.8-27B 模型卡:

思考模式(默认):

  • temperature=1.0
  • top_p=0.95
  • top_k=20
  • min_p=0.0
  • presence_penalty=0.0
  • repetition_penalty=1.0
  • reasoning_effort=xhigh 以获得最深度的推理

指令 / 非思考模式:

  • temperature=0.7
  • top_p=0.80
  • top_k=20
  • min_p=0.0
  • presence_penalty=1.5
  • repetition_penalty=1.0
  • enable_thinking=false

Qwen3.8 支持 xhigh、medium 和 low 三档推理强度。在官方模型契约中,思考模式与保留推理默认开启。

重要提示:

  • 使用 --jinja 启用内置聊天模板。
  • 视觉功能请使用 BF16 投影层。
  • 模型原生最大上下文长度为 262144。
  • 上下文长度与 KV 精度会显著占用显存。如果您的负载不需要最大原生上下文,请优先缩短上下文长度,而非降低模型质量。
  • 在较低配置档位上,保持默认的 F16 K/V,除非显存压力确实需要调整。

如果您的 llama.cpp 构建版本无法识别推理或 MTP 相关参数,请进行更新。较旧的构建版本可能仍能加载 GGUF,但无法完整支持 Qwen3.8 的推理服务路径。

关闭思考模式

Qwen3.8 默认启用思考模式。当您希望获得更简短、更快速的直接回答时,可将其关闭。

以 llama-server 为例,对所有请求的默认设置:

--chat-template-kwargs '{"enable_thinking":false}'

通过兼容OpenAI的API调用示例:

{
  "model": "qwen3.8-27b-aggressive-q3",
  "messages": [{"role": "user", "content": "..."}],
  "chat_template_kwargs": {"enable_thinking": false}
}

多轮智能体示例,使用以下方式保留先前的推理上下文:

{
  "chat_template_kwargs": {"preserve_thinking": true}
}

兼容性

  • llama.cpp: 推荐使用;请采用支持 Qwen3.8/MTP 的当前版本构建
  • LM Studio、Jan、KoboldCpp 及其他 GGUF 前端: 基础兼容性取决于其内置的 llama.cpp 版本
  • 嵌入式 MTP: 可选功能,在当前 llama.cpp 中保持默认兼容
  • HauhauCS FastMTP: 可选;需配合 sidecar 文件及 HauhauCS-FastMTP-llama.cpp.patch 使用
  • 视觉能力: 需单独加载 BF16 projector 文件
  • K_P 显示: 在不识别该后缀的界面中可能显示为 ?

完整性验证

每个 GGUF 文件均由已签名的 HauhauCS 发布清单覆盖。重命名后,精确的 SHA-256 值可用于识别逐字节一致的镜像副本;标准张量指纹可持续用于识别经仅元数据重写后的 HauhauCS 张量。

FastMTP sidecar 文件的确切 SHA-256 为 115e618e1f73cb50817ed5856f0551c6bf9c3d94df96f440eaca78dc63b8968b;其标准张量指纹为 49e248e799f169b6ccc6a8127b9300a95f06cf3d96a8353266f5d457e81d1c87。公钥 DER 指纹为 f7be4a2335582ab7b2e393ca1c40ce70e483f1492c0f57b8c6e05d8a7223833c。

请下载 HauhauCS-RELEASE-MANIFEST.json 及其签名文件、FastMTP-PROVENANCE.json 及其签名文件、以及 HauhauCS-FastMTP-Ed25519-PUBLIC.pem,随后进行验证:

openssl pkeyutl -verify -rawin -pubin \
  -inkey HauhauCS-FastMTP-Ed25519-PUBLIC.pem \
  -in FastMTP-PROVENANCE.json \
  -sigfile FastMTP-PROVENANCE.json.sig

openssl pkeyutl -verify -rawin -pubin \
  -inkey HauhauCS-FastMTP-Ed25519-PUBLIC.pem \
  -in HauhauCS-RELEASE-MANIFEST.json \
  -sigfile HauhauCS-RELEASE-MANIFEST.json.sig

其他模型

  • HauhauCS 系列模型(Hugging Face)

Qwen3.8-27B 由 Qwen 团队根据 Apache 2.0 许可证发布。本量化版 Aggressive 变体同样遵循该许可证。