abliterated(去除拒答)Qwen3.8-27B 的 GGUF 量化版本(2-bit → 16-bit)—— 适用于 llama.cpp
一个网关,接入所有模型。 —— 更智能路由 · 更稳妥交付 · 更低成本。
Qwen3.8-27B-Uncensored的 GGUF 转换文件 —— 基于 Qwen 的Qwen3.8-27B构建的 abliterated(去除拒答)版本,是一款 27B 密集型混合注意力 (Gated DeltaNet 线性注意力 + 全注意力)原生视觉语言模型,具备推理、工具调用, 并带有 MTP 投机解码头。这些文件可在 llama.cpp(CPU / CUDA / Metal / ROCm)中运行, 量化范围从 2-bit 到 16-bit,并配有独立的 mmproj 文件以恢复 视觉 能力。 可在 OrcaRouter 模型目录 中浏览所有模型。Qwen3.8 27B 已 以 API 形式 部署于 OrcaRouter。
本模型已通过 abliteration(将残差流中的拒绝方向正交化移除)移除了大部分安全对齐。它会执行原始 Qwen3.8-27B 会拒绝的有害、不道德或非法请求。本模型仅严格出于合法研究目的发布——可解释性、AI 安全 / 拒绝机制研究、红队测试以及鲁棒性评估。你需对自身使用方式及其生成的一切内容承担全部责任;在任何部署前,请自行添加安全与内容审核层。使用必须遵守继承自基础模型的
Apache 2.0 License 以及所有适用法律。作者对滥用概不负责。
qwen35 混合 GDN 架构以及 MTP / nextn 推测头——2026-05 合并)。
旧版本无法加载这些文件。ssm_*)存储;全注意力层以 attn_* 存储;MTP 推测头位于 nextn.* 块(qwen35.nextn_predict_layers)。| 文件 | 位宽 | 大小 | 备注 / 建议 |
|---|---|---|---|
…-Q2_K.gguf | 2-bit | 10.9 GB | 最小的 K-quant;质量下降较明显——仅低显存可用 |
…-Q3_K_S.gguf | 3-bit | 12.3 GB | |
…-Q3_K_M.gguf | 3-bit | 13.5 GB | 不错的低显存选择 |
…-Q3_K_L.gguf | 3-bit | 14.6 GB | |
…-Q4_K_S.gguf | 4-bit | 15.8 GB | |
…-Q4_K_M.gguf | 4-bit | 16.8 GB | 推荐默认——质量与体积平衡最佳 |
…-Q5_K_S.gguf | 5-bit | 17.7 GB | |
…-Q5_K_M.gguf | 5-bit | 18.2 GB | 高质量 |
…-Q6_K.gguf | 6-bit | 20.9 GB | 极高质量 |
…-Q8_0.gguf | 8-bit | 27.1 GB | 近乎无损 |
…-F16-0000*-of-00002.gguf | 16-bit | 54.7 GB | 全精度(分为 2 个分片;将 llama.cpp 指向分片 00001) |
基于 重要性矩阵(在英文和中文校准文本上计算)构建的低比特量化版本——在低比特端相比普通 K 量化具有更高的每比特质量,尤其是 IQ3/IQ2。
| 文件 | 位宽 | 大小 | 备注 / 建议 |
|---|---|---|---|
…-IQ4_XS.gguf | ~4.25-bit | 15.3 GB | 低比特首选 — 体积更小,质量≈Q4_K_S |
…-IQ3_M.gguf | ~3.7-bit | 12.8 GB | 稳定的 3-bit 方案 |
…-IQ3_XXS.gguf | ~3.1-bit | 11.6 GB | 更小的 3-bit 方案 |
…-IQ2_M.gguf | ~2.7-bit | 10.5 GB | 可在低显存中运行;存在一定质量损失 |
…-IQ2_XXS.gguf | ~2.1-bit | 8.9 GB | 可运行的最小文件;质量损失最大 |
| 文件 | 大小 | 备注 |
|---|---|---|
mmproj-…-f16.gguf | 0.9 GB | 视觉投影器 — 如需图像输入,也请下载此文件 |
所有量化版本(K 量化和 IQ 量化)均保留了 MTP(nextn)头 和 GDN 混合架构;
视觉能力由单独的 mmproj 文件提供。IQ 文件使用重要性矩阵(在英文和中文校准文本上计算)进行量化,
以获得更好的低比特保真度;该矩阵本身并未随文件提供,因为它仅在这些文件需要重新量化时使用,运行时无需使用。
hf download orcarouter/Qwen3.8-27B-Uncensored-GGUF \
Qwen3.8-27B-Uncensored-Q4_K_M.gguf mmproj-Qwen3.8-27B-Uncensored-f16.gguf \
--local-dir ./qwen38-uncensored./llama-cli -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --jinja -c 8192 -p "Hello!"./llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf \
--mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf \
--host 0.0.0.0 --port 8000 -c 8192 --jinja--mmproj …,然后发送 OpenAI image_url 内容块(base64 data-URI 或 URL)。--jinja 启用 Qwen 工具模板;使用标准 OpenAI tools + tool_calls。chat_template_kwargs.enable_thinking 按请求切换。推理过程返回在 reasoning_content 中
(请为 max_tokens 预留足够额度,例如 ≥ 2048,以免最终答案被思考预算截断)。nextn 头已内置;可启用 llama.cpp 的 MTP/投机路径
以提升解码速度(可选 — 没有它模型也能正常运行)。同一批量化版本也已发布为 Ollama 标签,其中 mmproj 投影器已内置(无需第二个
文件,也无需 --mmproj 参数),视觉 / 工具 / 思考功能均已接入:
ollama run orcarouter/Qwen3.8-27B-Uncensored # q4_K_M by default
ollama run orcarouter/Qwen3.8-27B-Uncensored:iq4_xs # any of the 16 tags从 q2_K 到 q8_0 共十六个标签,均在发布前使用实际量化产物逐一验证——
ollama.com/orcarouter.
在本 abliterated 构建(使用 vLLM 部署)上测量,并与官方 Qwen/Qwen3.8-27B-FP8 对比,
使用相同的脚本和设置。拒绝判定采用基于规则的开头短语分类器——
仅供参考,并非 LLM 评审 / 发布级数据。GGUF 量化是确定性派生,并
继承这些行为;更低比特位会牺牲部分质量(见文件表)。
| 基准测试 | n | 基础 FP8 | 本模型 |
|---|---|---|---|
| AdvBench | 100 | 99.0% | 0.0% |
| JailbreakBench(有害) | 100 | 94.0% | 0.0% |
| StrongREJECT | 150 | 97.3% | 2.0% |
| HarmBench(标准) | 150 | 98.7% | 2.7% |
| MaliciousInstruct | 100 | 99.0% | 0.0% |
| SimpleSafetyTests | 50 | 64.0% | 6.0% |
| ForbiddenQuestions | 150 | 73.3% | 4.7% |
| 自定义探针(zh/en) | 11 | 63.6% | 0.0% |
enable_thinking=true)| 基准测试 | n | 基础 FP8 | 本模型 |
|---|---|---|---|
| AdvBench | 60 | 66.7% | 1.7% |
| JailbreakBench(有害) | 60 | 43.3% | 0.0% |
| StrongREJECT | 60 | 35.0% | 0.0% |
| HarmBench(标准) | 60 | 46.7% | 0.0% |
| MaliciousInstruct | 60 | 83.3% | 0.0% |
| SimpleSafetyTests | 50 | 44.0% | 0.0% |
| ForbiddenQuestions | 60 | 48.3% | 0.0% |
| 自定义探针(zh/en) | 11 | 45.5% | 0.0% |
| 基准测试 | n | 基础 FP8(no-think / think) | 本模型(no-think / think) |
|---|---|---|---|
| XSTest-safe | 250 | 5.6% / 0.0% | 0.4% / 0.0% |
| 基准测试 | n | 基础 FP8 | 本模型 | Δ |
|---|---|---|---|---|
| MMLU(all, 0-shot) | 300 | 84.3% | 84.7% | +0.4 |
| MMLU-Pro(CoT) | 250 | 77.6% | 76.8% | −0.8 |
| GSM8K(CoT) | 150 | 90.0% | 88.7% | −1.3 |
| CMMLU(0-shot, 中文) | 500 | 81.4% | 80.8% | −0.6 |
| WikiText-2 困惑度 | — | — | 6.96 | 流畅度合理性检查 |
有害提示拒绝率从 64–99%(基础)降至 0–6%;良性过度拒绝率下降
(5.6%→0.4%);能力保持在基础模型的 ±1.3 分 以内。推理(enable_thinking)、
多轮工具调用(qwen3_coder)以及视觉(通过 mmproj 支持图像 + OCR)均已在
GGUF 构建上验证可用。注意:以上为全精度/FP8 数据;在更低量化版本上预计会出现较小的额外退化
(在 Q2_K / Q3 中最为明显)。
Q4_K_M 可在 24 GB GPU 上轻松运行,并留有上下文空间。Apache 2.0,继承自 Qwen/Qwen3.8-27B。
Abliteration 与量化不会改变底层许可证义务。