SummFlow 2026-05-18 Hugging Face

Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF (DavidAU)

解禁版Qwen3.6-27B量化模型,为创意写作与代码而生

入选理由
GGUF格式可直接用Ollama部署;下载36万体现社区认可;基于Qwen3.6微调提升性能并去审查
对位
替代Qwen3.6-27B官方模型
适合
创意写作与角色扮演 / 图像理解与代码生成
不适合
需严格内容过滤的场景
规模
27B · 256k
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / koboldcpp
血统
量化自 Qwen3.6-27B-Heretic2-Uncensored-Finetune-Thinking
可信度
357k下载,量化指标公开,Q4_K_S的Mean KLD 0.0174,精度94% BF16

社区实测

Qwen 3.6 27B的去安全对齐版本,拒绝率从99%降至4%,经Unsloth微调后作者声称在基准测试上超过原版。配合双矩阵量化,Q4ks保持94%全精度,最低IQ2_M(约10.5GB)仍保留约83%性能,显著降低本地部署门槛。

  • 去安全对齐:拒绝率从99%降至4%,可回答原版拒绝的敏感话题
  • 经Unsloth微调后基准测试得分超过原始Qwen 3.6 27B
  • Q4ks量化保持94% BF16全精度性能,兼顾体积与质量
  • IQ2_M量化仅约10.5GB,仍保留约83%性能,低显存可跑
  • 双矩阵(Di-Matrix)量化在压缩体积的同时保持高达98%原始精度
  • 支持llama.cpp、vLLM、Docker Model Runner、Unsloth Studio等多种本地部署方式
  • Heretic v2版本已推出且声称拒绝率更低,此版本可能已被迭代
  • MoE稀疏变体(如35B A3B)的Heretic版本尚未可用,调优稀疏MoE需大量VRAM和时间
  • 无Discord等社区支持渠道
  • MTP(多令牌预测)支持状态不明
  • IQ2_M级别量化仍有约17%性能损失
  • 即使经过Heretic处理,仍有4%拒绝率残留

截至 2026-07-05

快速上手

llama-server -hf DavidAU/Qwen3.6-27B-Heretic-Uncensored-FINETUNE-NEO-CODE-Di-IMatrix-MAX-GGUF