模型 / Qwen3.6-35B-A3B-Genesis-Hermes-V5-GGUF (LuffyTheFox)

Qwen3.6-35B-A3B-Genesis-Hermes-V5-GGUF (LuffyTheFox)

无审查多模态 MoE,支持 Hermes 工具调用,为创作者

作者 LuffyTheFox

仓库标识LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF

~21GB 4-bit许可 可商用任务 智能体最近核对 2026-08-05
格式
4-bit
文件
~18GB
运行内存
~21GB–27GB
运行时
LLAMA-SERVER
下载
24,982

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF --jinja

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
基于Qwen3.6-MoE的GGUF模型,支持图像输入和262K上下文,可直接用llama.cpp运行;适合需要未审查能力和多模态的开发者。
对位
激活约3B,对位 Qwen2.5-3B 等多模态模型。
适合
无审查角色扮演与创意写作 / Hermes 风格函数调用 Agent
不适合
需官方支持或敏感合规的场景

独立证据与社区反馈

8 个独立来源 · 另 6 官方/转载最近验证 2026-08-05

社区认为该模型是 Qwen3.6-35B 的完整无损去审查版本,通过纯数值手术修复了原始权重中 750 万+死张量块和 SSM 层漂移问题,在长上下文、角色扮演和通用问答场景表现稳定,但编程能力明显弱于同系列 27B Genesis 版本,低量化版本在复杂任务上质量下降严重,整体性价比受限于较高的硬件门槛。

  • 完全去审查,0/465 次拒绝,保留原始模型全部能力
  • 修复了原始权重中 7,528,285 个死张量块/零值神经元,恢复专家多样性
  • 修复了 SSM 卷积层(blk.36-38)的尺度漂移,长上下文记忆状态更稳定
  • 支持 200K 上下文窗口,实测 5 次会话无故障、无循环、无重复工具调用
  • 兼容 llama.cpp、LM Studio、koboldcpp 等主流本地推理运行时
  • 修复后模型可再次微调
  • 支持 OpenClaw、Docker Model Runner、Lemonade 等多种部署方式
  • 在 LM Studio 中提供 HermesBench 基准测试与配置指南
  • Q4_K_P 及以下量化等级编程能力显著下降,高量化或全精度才能保持编程质量
  • Plus 版本因用户反馈基准一致性测试失败已被删除
  • 编程能力不如同系列 27B Genesis 版本
  • Q4KM 量化在复杂真实任务上质量衰减明显,与全精度版本差距大
  • 系统提示必须以 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' 开头,否则性能下降
  • NL2Repo 编程基准仅 29.4%,与最佳模型差距 26.5 个百分点
  • 公开排行榜排名 #114/215,综合得分 50.44/100
  • Q8_K_P 量化需约 43.6 GB 显存,硬件门槛较高

可信度下载量24,982,赞117。基于 Qwen3.6-35B-A3B 无审查版本与 Hermes 数据再生。

完整规格

规模
35B (激活 3B) · 262K (可扩展至 1M) · 下载 ~18GB · 显存最低 ~21GB · 推荐 ~27GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / koboldcpp
工具调用
Hermes 风格 function calling
血统
量化自 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1104.1k → 941.7k · likes +184

观测时间线

模型家族

查看全部家族 →