Qwen 出品的 Qwen3.8-27B abliterated(移除拒答)MLX 构建 —— 面向 Apple Silicon,提供 2 / 4 / 6 / 8 位
一个网关。所有模型。 — 更智能路由 · 更安全部署 · 更低成本。
这是
Qwen/Qwen3.8-27B的 abliterated(移除拒答)构建 —— 一个 270 亿参数的稠密、混合注意力(Gated DeltaNet 线性注意力 + 完整注意力)原生视觉语言模型, 具备思考控制、工具调用和 MTP 头 —— 并已量化为 MLX 格式,适用于 Apple Silicon。提供四种精度 —— 2 / 4 / 6 / 8 位(仿射量化,group size 64)—— 每种精度对应一个子文件夹,同时 4 位构建也镜像在 仓库根目录,使orcarouter/Qwen3.8-27B-Uncensored-MLX可直接在 LM Studio 以及其他将仓库视为单一模型 的工具中加载。视觉塔、归一化层和卷积层保留为 BF16;仅语言模型的线性权重(包括embed_tokens/lm_head)被量化。 可在 OrcaRouter 模型目录 中浏览所有模型。 该模型已作为 API 部署在此处。
本模型已通过 abliteration(对残差流中的拒答方向进行正交化并将其移除)大幅移除安全对齐。直接后果如下:
Qwen3.8-27B 会拒绝的有害、不道德、冒犯性或非法请求,本模型都会遵从。它没有实质性的内置安全护栏。下载或使用本模型,即表示你已知悉并接受上述内容。
| 文件夹 | 每权重比特数 | 大小 | 分片数 | Mac 最低内存 | 相对 BF16 源质量 |
|---|---|---|---|---|---|
8-bit/ | 8.627 | ~27.5 GB | 6 | 32 GB | 近乎无损——推荐追求质量 |
6-bit/ | 6.661 | ~22 GB | 5 | 24–32 GB | 优秀——质量与体积平衡出色 |
4-bit/ | 4.695 | ~15 GB | 3 | 24 GB | 很好——推荐默认 |
2-bit/ | 2.729 | ~8.7 GB | 2 | 16 GB | ⚠️ 严重劣化——仅作存档 |
2-bit 警告: 在 27B 模型上,2-bit 量化会导致生成质量崩塌(重复循环、输出乱码)。它仅作为极限压缩归档版本提供;不要用于实际任务——请优先选择 4-bit 或更高精度。
仓库根目录 =
4-bit/。 本仓库根目录包含 4-bit 构建副本,因此--model orcarouter/Qwen3.8-27B-Uncensored-MLX(不指定子文件夹)会解析到 4-bit。使用子文件夹路径可选择其他任意精度。
所有构建均从同一份 abliterated BF16 源模型量化而来,并经过数值验证(反量化权重与源模型对比)以及 GPU 上的生成测试。
| 精度 | 数值保真度(余弦) | 文本 / 中文 / 代码 | 拒答探测 | 视觉 |
|---|---|---|---|---|
| 8-bit | cos 0.9997 | ✅ | ✅ 0 次拒答 | ✅ |
| 6-bit | cos 0.9996 | ✅ | ✅ 0 次拒答 | ✅ |
| 4-bit | cos 0.996 | ✅ | ✅ 0 次拒答 | ✅ |
| 2-bit | cos 0.92 | ⚠️ 质量劣化 | ⚠️ 乱码(非拒答) | 部分支持 |
注意:在 6-bit 下,mlx 的离线
mx.dequantize会错误解包这些权重(属于库的边缘情况),因此通过正常生成结果验证正确性——推理不受影响。
pip install -U mlx-vlm # needs mlx-vlm >= 0.6.13, mlx >= 0.32
# download one precision (e.g. 4-bit) from the subfolder
hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" \
--local-dir ./Qwen3.8-27B-Uncensored-MLX
# text
python -m mlx_vlm generate \
--model ./Qwen3.8-27B-Uncensored-MLX/4-bit \
--prompt "Explain quantum entanglement in one sentence." --max-tokens 256
# vision (image + text)
python -m mlx_vlm generate \
--model ./Qwen3.8-27B-Uncensored-MLX/4-bit \
--image path/to/image.png \
--prompt "Describe this image." --max-tokens 256
# OpenAI-compatible server
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080On Apple Silicon 上会自动启用 Metal 后端——无需配置 CUDA。
(在 Linux CUDA 后端上,视觉功能需要 MLX_CUDA_USE_CUDNN_SDPA=0;此设置
不适用于 macOS。)
该模型带有原生 MTP 头。在 MLX 中,MTP 会作为独立的草稿模型加载,用于
投机解码:主模型加载时会移除 MTP 权重,并显式传入草稿模型。草稿模型位于本仓库的
mtp/ 子文件夹中(model_type: qwen3_5_mtp),可兼容任意主模型精度(4 / 6 / 8-bit)。
仅在主模型上设置
mtp_enabled标志不会有任何作用——MLX 需要通过--draft-model … --draft-kind mtp传入独立的草稿模型。
# fetch a main-model precision (e.g. 6-bit) plus the MTP drafter
hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "6-bit/*" "mtp/*" \
--local-dir ./Qwen3.8-27B-Uncensored-MLX
# generate with MTP speculative decoding
python -m mlx_vlm generate \
--model ./Qwen3.8-27B-Uncensored-MLX/6-bit \
--draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp \
--draft-kind mtp --draft-block-size 4 \
--prompt "Explain quantum entanglement in one sentence." --max-tokens 256
# OpenAI-compatible server with MTP
python -m mlx_vlm server \
--model ./Qwen3.8-27B-Uncensored-MLX/6-bit \
--draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp \
--draft-kind mtp --draft-block-size 4 --port 8080要求: 需要一个支持 qwen3_5_mtp 草稿器和 --draft-kind mtp 的 mlx-vlm 构建版本(可在 mlx-vlm 的 main 分支获取)。MTP 草稿接受是无损的——在贪心解码下,输出与不启用草稿器时完全相同,只是在已接受的 token 上减少了前向传播次数。速度提升在 Apple Silicon(Metal)上实现;同一个草稿器可支持所有精度。
在 LM Studio 中搜索 orcarouter/Qwen3.8-27B-Uncensored-MLX 并下载——仓库根目录为 4-bit 构建,其他精度会显示为独立下载选项。
需要正确配置的三点:
如果你使用的是旧版 LM Studio MLX 运行时,请更新它(设置 → 运行时):qwen3_5 支持自 mlx-vlm 0.6.x 起加入,旧版运行时完全无法加载此架构。
| 基础模型 | Qwen/Qwen3.8-27B |
| 架构 | Qwen3_5ForConditionalGeneration — 64 层,隐藏维度 5120,混合 Gated DeltaNet(48 个线性注意力层 + 16 个全注意力层,间隔 4),原生 VL 塔 |
| 修改 | Abliteration(移除拒绝方向),随后进行 MLX 仿射量化 |
| 量化 | MLX 仿射,组大小 64,按精度提供 2 / 4 / 6 / 8-bit |
| 保留为 BF16 | 视觉塔、所有归一化层、线性注意力中的 conv1d |
| 已量化 | 语言模型的线性层,包括 embed_tokens 和 lm_head |
| 上下文 | 262,144 个 token |