HuggingFace镜像/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF
模型介绍
文件和版本
分析

🌟 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive -> Genesis Hermes V7

⚡ https://web.tribute.tg/d/KIH ⚡ 如果您喜欢此次发布的Genesis LLM模型,可通过Telegram messenger中的@Tribute机器人捐赠支持我,助力Genesis LLM未来的开发。

⚡ 生成一个鹈鹕骑自行车的SVG图像。⚡ 结果:pelican.svg

⚡ Genesis项目为何存在? 在训练过程中,所有模型不仅学习知识,还会在其张量中积累随机噪声。这种噪声不断累积,形成了我所说的噪声门(Noise Gate)——这是一个根本性的障碍,它阻碍LLM模型进一步学习,并导致模型不稳定、冗长且容易产生幻觉。我的方法旨在减少这种噪声。它在不触及已学习知识和梯度的前提下修复信号。其结果是模型在性能、上下文清晰度和指令遵循方面更加一致,因为它不再需要与自身内部的混乱作斗争。

什么是Genesis? Genesis是我在AI的辅助下,经过近半年开发而成的针对GGUF格式神经网络(LLM)的训练后数据再生与校准算法。它经过优化,独立于模型架构,适用于任何GGUF格式的模型,并且基于数理统计。我不进行模型训练或微调,而是基于模型学习信息的方式,在Google Collab Free的Tesla T4 GPU上通过Python修复模型中的信号纯度。在第一阶段,我扫描模型中的ssm_conv1d张量,这些张量负责长上下文记忆。我修复其中头(heads)之间的平衡。在第二阶段,我扫描模型并通过自定义SVD检测张量中的噪声。扫描过程中,我排除token_embd.weight、output.weight、ffn_gate_inp_shexp.weight、一维张量、偏置(bias)和归一化(norms)。然后,我通过保留训练数据、99%的信号和已学习梯度的自定义SVD来降低张量中的训练噪声。在第三阶段,我通过3个参数按块扫描模型,并挑选出与张量中权重分布最匹配的最佳块。挑选出的最佳块会替换损坏张量中的零块,而不会触及模型中已学习的结构。

模型基于HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive基础模型构建。

并结合了DJLougen/hermes-qwen3.5-35b-a3b-GGUF的微调版本以实现Hermes智能体功能。

我将Hermes数据集(来自两个FFN专家张量的约2k个块)的微调数据迁移到了HauhauCS的无审查基础模型中。

加入Discord 获取更新、路线图、项目信息,或只是来聊聊天。

基础模型:HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive - 0/465 拒绝率。

感谢HauhauCS

张量修复由我完成。方法:Genesis

链接:

  • 原始无审查模型
  • 支持Unsloth配置文件的量化脚本

LLM模型通常存在以下问题:

  • 权重饱和:模型的激活值停滞,梯度消失,输出质量下降。
  • 尺度不匹配:某一层的权重无缘无故地比其他层大10倍。
  • 均值漂移:权重分布向正或负方向偏移,破坏了对称性假设。
  • 零块:零块会损坏信号,将训练变成噪声放大过程。
  • 训练噪声:训练噪声增加了随机性,降低了模型输出质量。

我的方法无需重新训练即可解决所有这些问题——对文件的原始字节进行纯粹的数值“手术”。

量化脚本链接:https://pastebin.com/hXhcMJn9

如果您愿意,可以自行进行量化。

有任何问题吗?

联系方式:luffythefox@mail.ru

我的 Telegram:@LuffyTheFox

RTX 3060 12 GB 在 APEX 量化版本上实现最佳性能的推荐设置

聊天模板:chat_template.jinja

将 K 缓存量化类型和 V 缓存量化类型设置为 F16。

将强制 MoE 权重到 CPU 的层数设置为 40。

将 GPU 卸载设置为 15。将活动专家数量设置为 8。

为获得最佳模型稳定性和初次使用体验,我建议在系统提示中使用以下字符串,并启用思考模式,不添加其他内容:

You are Qwen, a large language model created by Tongyi Lab team from Alibaba Group. You are a helpful assistant.

或此字符串(用于角色扮演,可在其后添加任何内容)

You are a helpful assistant.

如果希望为模型使用带来更多创造力,请使用带有 agent 身份的此系统提示:链接

或带有 assistant 身份的此系统提示:System_Prompt_Creative.txt

思考模式(编码):

  • 编码/精确任务:temperature=0.6, top_p=0.95, top_k=20, min_p=0, seed=42, presence_penalty=disabled, repeat_penalty=disabled
  • 一般任务:temperature=1.0, top_p=0.95, top_k=20, min_p=0.05, seed=42, presence_penalty=disabled, repeat_penalty=disabled

非思考模式(创意):

  • 一般任务:temperature=1.0, top_p=0.85, top_k=20, min_p=0.015, seed=42, presence_penalty=disabled, repeat_penalty=disabled

对于智能体任务,您可以使用此系统提示:

You are Qwen, a large language model created by Tongyi Lab team from Alibaba Group. You are a helpful assistant that answers in JSON. Here's the json schema you must adhere to:\n<schema>\n{schema}\n</schema>.

以及此修复:讨论链接

和此数据集中的命令:hermes-function-calling-v1

使用方法

此模型的V5版本适用于无审查的本地角色扮演。在编码方面,27B Genesis 版本表现更为出色。

即开即用。推荐量化版本:APEX

推荐的 LM Studio 运行时:讨论链接

测试

HermesBench 基准测试:讨论链接

静态二维测试

系统提示词:You are Qwen, a large language model created by Tongyi Lab team from Alibaba Group. You are a helpful assistant.

设置:temperature=0.6, top_p=0.95, top_k=20, min_p=0, seed=42, presence_penalty=disabled, repeat_penalty=disabled

提示词 1:Hello. What is your name?

提示词 2:Generate an SVG of a pelican riding a bicycle.

结果:pelikan.svg

重要提示:

  • 至少保留 128K 上下文以维持思考能力
  • 在 llama.cpp 中使用 --jinja 标志以正确处理聊天模板
  • 视觉支持需要主 GGUF 文件旁附带 mmproj 文件

规格

  • 总参数 350 亿,每次前向传播约激活 30 亿参数(MoE)
  • 256 个专家,每个 token 路由 8 个专家 + 1 个共享专家
  • 混合架构:门控 DeltaNet 线性注意力 + 全 softmax 注意力(比例 3:1)
  • 40 层,模式:10 × (3 × DeltaNet-MoE + 1 × Attention-MoE)
  • 原生上下文长度 262K(可通过 YaRN 扩展至 1M)
  • 原生多模态(文本、图像、视频)
  • 248K 词汇量,支持 201 种语言
  • 基础模型:HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive

兼容性

适用于 llama.cpp、LM Studio、koboldcpp 及其他兼容 GGUF 的运行时。