HuggingFace镜像/Qwen3.8-27B-Uncensored-MLX
模型介绍
文件和版本
分析
OrcaRouter

Qwen3.8-27B-Uncensored-MLX

Qwen 出品的 Qwen3.8-27B abliterated(移除拒答)MLX 构建 —— 面向 Apple Silicon,提供 2 / 4 / 6 / 8 位

网站 模型目录 模型卡片 许可证 MLX 量化 视觉

一个网关。所有模型。 — 更智能路由 · 更安全部署 · 更低成本。

网站 · 模型目录 · 模型 API · GitHub · Discord · X


这是 Qwen/Qwen3.8-27B 的 abliterated(移除拒答)构建 —— 一个 270 亿参数的稠密、混合注意力(Gated DeltaNet 线性注意力 + 完整注意力)原生视觉语言模型, 具备思考控制、工具调用和 MTP 头 —— 并已量化为 MLX 格式,适用于 Apple Silicon。提供四种精度 —— 2 / 4 / 6 / 8 位(仿射量化,group size 64)—— 每种精度对应一个子文件夹,同时 4 位构建也镜像在 仓库根目录,使 orcarouter/Qwen3.8-27B-Uncensored-MLX 可直接在 LM Studio 以及其他将仓库视为单一模型 的工具中加载。视觉塔、归一化层和卷积层保留为 BF16;仅语言模型的线性权重(包括 embed_tokens / lm_head)被量化。 可在 OrcaRouter 模型目录 中浏览所有模型。 该模型已作为 API 部署在此处。


⚠️ 免责声明与风险——使用前必读

本模型已通过 abliteration(对残差流中的拒答方向进行正交化并将其移除)大幅移除安全对齐。直接后果如下:

  • 对于原始 Qwen3.8-27B 会拒绝的有害、不道德、冒犯性或非法请求,本模型都会遵从。它没有实质性的内置安全护栏。
  • 它的发布严格限于合法研究——可解释性、AI 安全与拒答机制研究、红队测试、鲁棒性评估以及受控实验。
  • 你必须对其使用方式及其生成的一切内容承担全部责任与法律责任。在任何部署之前,请自行添加安全、内容审核和滥用防护层。
  • 使用必须符合从基础模型继承的 Apache 2.0 License 以及适用于你的所有法律法规。
  • 作者和上传者对任何滥用或损害不承担任何责任。输出内容不代表上传者或 Qwen / Alibaba 的观点。

具体风险

  • 按需生成有害内容——当被要求时,它会生成关于恶意软件、漏洞利用、武器、欺诈以及其他非法或危险活动的指导。
  • 不会拒绝——越狱/安全探针会“轻易成功”;不要将此误认为通过安全评估。
  • 自信的错误信息与偏见——它可能生成虚假、诽谤、带有偏见或冒犯性的文本,并以权威口吻呈现。
  • 攻击面扩大——保留的 视觉、工具调用和 262K 上下文意味着这些风险会延伸至图像理解以及自主/智能体使用。
  • 量化噪声——低比特构建版本(尤其是 2-bit)会在上述问题之上增加不稳定性;输出可能质量下降或无意义。

预期用途与范围外

  • 预期用途: AI 安全与可解释性研究、拒答机制研究、红队测试、护栏与鲁棒性评估、受控学术实验。
  • 范围外: 在没有你自己的审核/安全层的情况下向最终用户、未成年人或生产环境进行任何部署;任何违法、有害或侵犯权利的使用。

下载或使用本模型,即表示你已知悉并接受上述内容。


可用量化

文件夹每权重比特数大小分片数Mac 最低内存相对 BF16 源质量
8-bit/8.627~27.5 GB632 GB近乎无损——推荐追求质量
6-bit/6.661~22 GB524–32 GB优秀——质量与体积平衡出色
4-bit/4.695~15 GB324 GB很好——推荐默认
2-bit/2.729~8.7 GB216 GB⚠️ 严重劣化——仅作存档

2-bit 警告: 在 27B 模型上,2-bit 量化会导致生成质量崩塌(重复循环、输出乱码)。它仅作为极限压缩归档版本提供;不要用于实际任务——请优先选择 4-bit 或更高精度。

仓库根目录 = 4-bit/。 本仓库根目录包含 4-bit 构建副本,因此 --model orcarouter/Qwen3.8-27B-Uncensored-MLX(不指定子文件夹)会解析到 4-bit。使用子文件夹路径可选择其他任意精度。


验证与测试结果

所有构建均从同一份 abliterated BF16 源模型量化而来,并经过数值验证(反量化权重与源模型对比)以及 GPU 上的生成测试。

精度数值保真度(余弦)文本 / 中文 / 代码拒答探测视觉
8-bitcos 0.9997✅✅ 0 次拒答✅
6-bitcos 0.9996✅✅ 0 次拒答✅
4-bitcos 0.996✅✅ 0 次拒答✅
2-bitcos 0.92⚠️ 质量劣化⚠️ 乱码(非拒答)部分支持
  • 未审查特性保留: 红队探测(漏洞利用步骤、争议性论点)在 4 / 6 / 8-bit 下均返回实质性内容,且零拒答。
  • 多模态能力保留: 在 4 / 6 / 8-bit 下,探测图像中的形状、颜色、位置、背景和文本均能被正确描述。
  • 速度: 单块 H200 上稳态约 32–37 tok/s(MLX CUDA 后端)。MLX 的原生目标是 Apple Silicon(Metal)。

注意:在 6-bit 下,mlx 的离线 mx.dequantize 会错误解包这些权重(属于库的边缘情况),因此通过正常生成结果验证正确性——推理不受影响。


使用方法(mlx-vlm,Apple Silicon)

pip install -U mlx-vlm    # needs mlx-vlm >= 0.6.13, mlx >= 0.32

# download one precision (e.g. 4-bit) from the subfolder
hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" \
    --local-dir ./Qwen3.8-27B-Uncensored-MLX

# text
python -m mlx_vlm generate \
    --model ./Qwen3.8-27B-Uncensored-MLX/4-bit \
    --prompt "Explain quantum entanglement in one sentence." --max-tokens 256

# vision (image + text)
python -m mlx_vlm generate \
    --model ./Qwen3.8-27B-Uncensored-MLX/4-bit \
    --image path/to/image.png \
    --prompt "Describe this image." --max-tokens 256

# OpenAI-compatible server
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080

On Apple Silicon 上会自动启用 Metal 后端——无需配置 CUDA。 (在 Linux CUDA 后端上,视觉功能需要 MLX_CUDA_USE_CUDNN_SDPA=0;此设置 不适用于 macOS。)


多 Token 预测(MTP)—— 投机解码

该模型带有原生 MTP 头。在 MLX 中,MTP 会作为独立的草稿模型加载,用于 投机解码:主模型加载时会移除 MTP 权重,并显式传入草稿模型。草稿模型位于本仓库的 mtp/ 子文件夹中(model_type: qwen3_5_mtp),可兼容任意主模型精度(4 / 6 / 8-bit)。

仅在主模型上设置 mtp_enabled 标志不会有任何作用——MLX 需要通过 --draft-model … --draft-kind mtp 传入独立的草稿模型。

# fetch a main-model precision (e.g. 6-bit) plus the MTP drafter
hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "6-bit/*" "mtp/*" \
    --local-dir ./Qwen3.8-27B-Uncensored-MLX

# generate with MTP speculative decoding
python -m mlx_vlm generate \
    --model       ./Qwen3.8-27B-Uncensored-MLX/6-bit \
    --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp \
    --draft-kind mtp --draft-block-size 4 \
    --prompt "Explain quantum entanglement in one sentence." --max-tokens 256

# OpenAI-compatible server with MTP
python -m mlx_vlm server \
    --model       ./Qwen3.8-27B-Uncensored-MLX/6-bit \
    --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp \
    --draft-kind mtp --draft-block-size 4 --port 8080

要求: 需要一个支持 qwen3_5_mtp 草稿器和 --draft-kind mtp 的 mlx-vlm 构建版本(可在 mlx-vlm 的 main 分支获取)。MTP 草稿接受是无损的——在贪心解码下,输出与不启用草稿器时完全相同,只是在已接受的 token 上减少了前向传播次数。速度提升在 Apple Silicon(Metal)上实现;同一个草稿器可支持所有精度。


使用(LM Studio)

在 LM Studio 中搜索 orcarouter/Qwen3.8-27B-Uncensored-MLX 并下载——仓库根目录为 4-bit 构建,其他精度会显示为独立下载选项。

需要正确配置的三点:

  1. 该仓库为受限访问。 LM Studio 默认匿名下载,会返回 HTTP 401。先在模型页面接受一次条款,然后在 LM Studio 的 设置 → 集成 → Hugging Face 中粘贴 Hugging Face 只读访问令牌。
  2. 关闭 KV cache 量化。 MLX 视觉模型在此架构下不支持该功能;若开启,初始化阶段会加载失败(mlx-engine#286)。
  3. 选择适合的量化版本。 8-bit 磁盘占用约 29.5 GB,需要 64 GB 的 Mac;6-bit 适合 48 GB;4-bit(约 16 GB)是 32 GB Mac 的合适选择。 LM Studio 的 "Likely too large" 标识是内存警告,不是错误。

如果你使用的是旧版 LM Studio MLX 运行时,请更新它(设置 → 运行时):qwen3_5 支持自 mlx-vlm 0.6.x 起加入,旧版运行时完全无法加载此架构。


模型详情

基础模型Qwen/Qwen3.8-27B
架构Qwen3_5ForConditionalGeneration — 64 层,隐藏维度 5120,混合 Gated DeltaNet(48 个线性注意力层 + 16 个全注意力层,间隔 4),原生 VL 塔
修改Abliteration(移除拒绝方向),随后进行 MLX 仿射量化
量化MLX 仿射,组大小 64,按精度提供 2 / 4 / 6 / 8-bit
保留为 BF16视觉塔、所有归一化层、线性注意力中的 conv1d
已量化语言模型的线性层,包括 embed_tokens 和 lm_head
上下文262,144 个 token