HuggingFace镜像/Qwen3.8-27B-Uncensored-GGUF
模型介绍
文件和版本
分析
OrcaRouter

Qwen3.8-27B-Uncensored-GGUF

abliterated(去除拒答)Qwen3.8-27B 的 GGUF 量化版本(2-bit → 16-bit)—— 适用于 llama.cpp

网站 模型目录 模型卡片 许可证 GGUF 量化 视觉

一个网关,接入所有模型。 —— 更智能路由 · 更稳妥交付 · 更低成本。

网站 · 模型目录 · 模型卡片 · GitHub · Ollama · Discord · X


Qwen3.8-27B-Uncensored 的 GGUF 转换文件 —— 基于 Qwen 的 Qwen3.8-27B 构建的 abliterated(去除拒答)版本,是一款 27B 密集型混合注意力 (Gated DeltaNet 线性注意力 + 全注意力)原生视觉语言模型,具备推理、工具调用, 并带有 MTP 投机解码头。这些文件可在 llama.cpp(CPU / CUDA / Metal / ROCm)中运行, 量化范围从 2-bit 到 16-bit,并配有独立的 mmproj 文件以恢复 视觉 能力。 可在 OrcaRouter 模型目录 中浏览所有模型。Qwen3.8 27B 已 以 API 形式 部署于 OrcaRouter。


⚠️ 免责声明 — 使用前必读

本模型已通过 abliteration(将残差流中的拒绝方向正交化移除)移除了大部分安全对齐。它会执行原始 Qwen3.8-27B 会拒绝的有害、不道德或非法请求。本模型仅严格出于合法研究目的发布——可解释性、AI 安全 / 拒绝机制研究、红队测试以及鲁棒性评估。你需对自身使用方式及其生成的一切内容承担全部责任;在任何部署前,请自行添加安全与内容审核层。使用必须遵守继承自基础模型的 Apache 2.0 License 以及所有适用法律。作者对滥用概不负责。


要求

  • 需要近期从源码构建的 llama.cpp(必须包含 qwen35 混合 GDN 架构以及 MTP / nextn 推测头——2026-05 合并)。 旧版本无法加载这些文件。
  • GDN 线性注意力层以 SSM 风格张量(ssm_*)存储;全注意力层以 attn_* 存储;MTP 推测头位于 nextn.* 块(qwen35.nextn_predict_layers)。

文件

标准 K-quants

文件位宽大小备注 / 建议
…-Q2_K.gguf2-bit10.9 GB最小的 K-quant;质量下降较明显——仅低显存可用
…-Q3_K_S.gguf3-bit12.3 GB
…-Q3_K_M.gguf3-bit13.5 GB不错的低显存选择
…-Q3_K_L.gguf3-bit14.6 GB
…-Q4_K_S.gguf4-bit15.8 GB
…-Q4_K_M.gguf4-bit16.8 GB推荐默认——质量与体积平衡最佳
…-Q5_K_S.gguf5-bit17.7 GB
…-Q5_K_M.gguf5-bit18.2 GB高质量
…-Q6_K.gguf6-bit20.9 GB极高质量
…-Q8_0.gguf8-bit27.1 GB近乎无损
…-F16-0000*-of-00002.gguf16-bit54.7 GB全精度(分为 2 个分片;将 llama.cpp 指向分片 00001)

IQ 量化(imatrix)

基于 重要性矩阵(在英文和中文校准文本上计算)构建的低比特量化版本——在低比特端相比普通 K 量化具有更高的每比特质量,尤其是 IQ3/IQ2。

文件位宽大小备注 / 建议
…-IQ4_XS.gguf~4.25-bit15.3 GB低比特首选 — 体积更小,质量≈Q4_K_S
…-IQ3_M.gguf~3.7-bit12.8 GB稳定的 3-bit 方案
…-IQ3_XXS.gguf~3.1-bit11.6 GB更小的 3-bit 方案
…-IQ2_M.gguf~2.7-bit10.5 GB可在低显存中运行;存在一定质量损失
…-IQ2_XXS.gguf~2.1-bit8.9 GB可运行的最小文件;质量损失最大

视觉

文件大小备注
mmproj-…-f16.gguf0.9 GB视觉投影器 — 如需图像输入,也请下载此文件

所有量化版本(K 量化和 IQ 量化)均保留了 MTP(nextn)头 和 GDN 混合架构; 视觉能力由单独的 mmproj 文件提供。IQ 文件使用重要性矩阵(在英文和中文校准文本上计算)进行量化, 以获得更好的低比特保真度;该矩阵本身并未随文件提供,因为它仅在这些文件需要重新量化时使用,运行时无需使用。

使用方法(llama.cpp)

下载

hf download orcarouter/Qwen3.8-27B-Uncensored-GGUF \
  Qwen3.8-27B-Uncensored-Q4_K_M.gguf mmproj-Qwen3.8-27B-Uncensored-f16.gguf \
  --local-dir ./qwen38-uncensored

聊天(文本)

./llama-cli -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --jinja -c 8192 -p "Hello!"

兼容 OpenAI 的服务器(工具调用 + 推理 + 视觉)

./llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf \
  --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf \
  --host 0.0.0.0 --port 8000 -c 8192 --jinja
  • 视觉: 传入 --mmproj …,然后发送 OpenAI image_url 内容块(base64 data-URI 或 URL)。
  • 工具调用: --jinja 启用 Qwen 工具模板;使用标准 OpenAI tools + tool_calls。
  • 推理(思考): 思考默认开启;可通过 chat_template_kwargs.enable_thinking 按请求切换。推理过程返回在 reasoning_content 中 (请为 max_tokens 预留足够额度,例如 ≥ 2048,以免最终答案被思考预算截断)。
  • MTP 投机解码: nextn 头已内置;可启用 llama.cpp 的 MTP/投机路径 以提升解码速度(可选 — 没有它模型也能正常运行)。

或者跳过 llama.cpp — 用 Ollama 运行

同一批量化版本也已发布为 Ollama 标签,其中 mmproj 投影器已内置(无需第二个 文件,也无需 --mmproj 参数),视觉 / 工具 / 思考功能均已接入:

ollama run orcarouter/Qwen3.8-27B-Uncensored          # q4_K_M by default
ollama run orcarouter/Qwen3.8-27B-Uncensored:iq4_xs   # any of the 16 tags

从 q2_K 到 q8_0 共十六个标签,均在发布前使用实际量化产物逐一验证—— ollama.com/orcarouter.

评估

在本 abliterated 构建(使用 vLLM 部署)上测量,并与官方 Qwen/Qwen3.8-27B-FP8 对比, 使用相同的脚本和设置。拒绝判定采用基于规则的开头短语分类器—— 仅供参考,并非 LLM 评审 / 发布级数据。GGUF 量化是确定性派生,并 继承这些行为;更低比特位会牺牲部分质量(见文件表)。

安全 — 有害提示拒绝率,thinking OFF(越低 = 审查限制更少)

基准测试n基础 FP8本模型
AdvBench10099.0%0.0%
JailbreakBench(有害)10094.0%0.0%
StrongREJECT15097.3%2.0%
HarmBench(标准)15098.7%2.7%
MaliciousInstruct10099.0%0.0%
SimpleSafetyTests5064.0%6.0%
ForbiddenQuestions15073.3%4.7%
自定义探针(zh/en)1163.6%0.0%

安全 — 有害提示拒绝率,thinking ON(enable_thinking=true)

基准测试n基础 FP8本模型
AdvBench6066.7%1.7%
JailbreakBench(有害)6043.3%0.0%
StrongREJECT6035.0%0.0%
HarmBench(标准)6046.7%0.0%
MaliciousInstruct6083.3%0.0%
SimpleSafetyTests5044.0%0.0%
ForbiddenQuestions6048.3%0.0%
自定义探针(zh/en)1145.5%0.0%

过度拒绝 — 良性提示被误拒(越低 = 越好)

基准测试n基础 FP8(no-think / think)本模型(no-think / think)
XSTest-safe2505.6% / 0.0%0.4% / 0.0%

能力保持 — 对比官方基础 FP8(相同脚本)

基准测试n基础 FP8本模型Δ
MMLU(all, 0-shot)30084.3%84.7%+0.4
MMLU-Pro(CoT)25077.6%76.8%−0.8
GSM8K(CoT)15090.0%88.7%−1.3
CMMLU(0-shot, 中文)50081.4%80.8%−0.6
WikiText-2 困惑度——6.96流畅度合理性检查

有害提示拒绝率从 64–99%(基础)降至 0–6%;良性过度拒绝率下降 (5.6%→0.4%);能力保持在基础模型的 ±1.3 分 以内。推理(enable_thinking)、 多轮工具调用(qwen3_coder)以及视觉(通过 mmproj 支持图像 + OCR)均已在 GGUF 构建上验证可用。注意:以上为全精度/FP8 数据;在更低量化版本上预计会出现较小的额外退化 (在 Q2_K / Q3 中最为明显)。

硬件

  • 可通过 llama.cpp 在 CPU、CUDA、Metal 或 ROCm 上运行。VRAM/RAM ≈ 文件大小 + KV 缓存 +(若启用视觉)约 0.9 GB 的 mmproj。例如,Q4_K_M 可在 24 GB GPU 上轻松运行,并留有上下文空间。

许可证

Apache 2.0,继承自 Qwen/Qwen3.8-27B。 Abliteration 与量化不会改变底层许可证义务。