模型 / Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3 (LuffyTheFox)

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3 (LuffyTheFox)

无审查视觉 MoE 模型,Hermes 工具调用,GGUF 本地推理

作者
LuffyTheFox
对位
对位 Qwen2.5-3B 密集模型(激活参数约 3B)
适合
无审查对话与多模态问答 / 本地 agent 工具调用
不适合
需安全审查的生产环境
入选理由
基于 Qwen3.6 的 MoE 多模态 GGUF,经信号修复和 Hermes 微调,可直接用 llama.cpp,适合 12GB 显存本地部署。
规模
35B (3B 激活) · 262K (可扩展至 1M) · Q4 ~23GB / FP16 ~84GB
授权
Apache-2.0 · 需自查
框架
llama.cpp / ollama / LM Studio / koboldcpp
工具调用
Hermes 风格 function calling
国内访问
需代理
可信度
HuggingFace 1.3 万下载,57 点赞,基于 Qwen3.6 与开源 Hermes 数据集

社区实测

这是一个社区驱动的无审查版 Qwen3.6-35B-A3B,通过纯数值修复恢复了原版中约 750 万死神经元和 SSM 层张量漂移,Genesis 版本是当前最完善的迭代。社区讨论集中在版本选择上,Plus 版因一致性测试失败已被作者撤回,作者建议 Genesis 版搭配 MXFP4_MOE 量化或 Wasserstein 版 Q4_K_P 以上量化使用。

  • 去除原版审查,声称 0/465 次拒绝,完全保留原版能力
  • 修复 FFN 专家层中约 750 万死神经元/零块,恢复专家多样性
  • 修复 SSM conv1d 层的张量漂移,改善长上下文记忆能力
  • Genesis 版本恢复后可进行微调
  • 兼容 llama.cpp、LM Studio、koboldcpp 等主流 GGUF 运行时
  • 提供多种量化版本,适配不同硬件条件
  • 系统提示词必须以特定首行开头,否则模型表现可能下降
  • 量化低于 Q4_K_P 时编程能力显著下降
  • Plus 版本因一致性基准测试失败已被作者撤回
  • Wasserstein(非 Plus)版本仅修复 SSM 层漂移,未修复死神经元
  • 不同版本的推荐量化格式不同(Genesis 推荐 MXFP4_MOE,Wasserstein 推荐 Q4_K_P)

截至 2026-07-19

本形态显存 Q4 ~23GB / FP16 ~84GB · 国内 需代理 · 13,390 下载

快速上手

llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF --jinja

本形态源 ↗

下载动量

观测时间线