模型 / Qwen3.6-27B-Heretic-GGUF (darkc0de)

Qwen3.6-27B-Heretic-GGUF (darkc0de)

Claude Opus推理蒸馏并反审查的27B模型GGUF版

作者
fzcfweasdferttgg
对位
对位 Gemma-2-27B
适合
复杂推理与多步逻辑 / 创意写作与无过滤对话
不适合
安全合规的生产环境
入选理由
Qwen3.6的Claude Opus推理蒸馏+去审查版,直接提供GGUF量化,8GB显存可跑Q2_K版本,适合需要高质量、无审查限制的本地推理用户。
规模
27B · 256K · 最低 ~16GB · 4-bit(估算)
授权
apache-2.0 · 需自查
框架
llama.cpp / ollama
血统
量化自 Qwen3.6-27B-Claude-Opus-Reasoning-Distill-v2-heretic
国内访问
需代理
可信度
基准 ARC +1.8%, BoolQ 持平; 拒绝率从 98/100 降至 8/100

社区实测

27B 密集模型在编码与 agentic 工作流中超越 397B MoE 前代,被社区公认同尺寸性价比顶尖;Heretic 无审查版在保持原模型能力的同时大幅降低拒答,且低量化版本在消费级硬件上即可流畅运行,速度与内存效率优于更大模型。

  • 27B 密集模型在编码基准上超越 397B MoE 前代,代码生成能力越级
  • 密集架构比 MoE 更易部署,本地推理门槛低
  • 量化版本(Q4_K_M)仅需约 17–20GB 显存即可在消费级硬件运行
  • Heretic 无审查版保持原模型能力的同时拒答率仅 6/100
  • 在 agentic 编码与终端基准测试(Terminal-Bench 2.0)中表现突出
  • 相比更大模型提供更快的推理速度与更低的内存占用
  • NEO Di-Matrix 量化技术在量化形式下仍保持接近原模型的高性能
  • 首个将无审查权重与完整 MTP 头结合的 GGUF 版本,补齐此前无审查版缺失 MTP 的短板
  • 不同 GGUF 量化上传者质量存在差异,需要根据 KL 散度等指标选择
  • 与专精编码模型(如 Coder-Next)相比并非在所有编码任务上都占优,选择需结合实际任务评估
  • SVG 等创意生成任务表现不够稳定,偶有失真

截至 2026-07-15

本形态 ~16GB 4-bit · 国内 需代理 · 132 下载

快速上手

ollama run hf.co/fzcfweasdferttgg/Qwen3.6-27B-Claude-Opus-Reasoning-Distill-v2-heretic-GGUF

本形态源 ↗

下载动量

30天下载 950 → 1.2k

观测时间线