模型 / Qwen3.6-27B-Heretic-GGUF (darkc0de)

Qwen3.6-27B-Heretic-GGUF (darkc0de)

Claude Opus推理蒸馏并反审查的27B模型GGUF版

作者 fzcfweasdferttgg

仓库标识fzcfweasdferttgg/Qwen3.6-27B-Claude-Opus-Reasoning-Distill-v2-heretic-GGUF

显存未知许可 可商用最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
OLLAMA
下载
132

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/fzcfweasdferttgg/Qwen3.6-27B-Claude-Opus-Reasoning-Distill-v2-heretic-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Qwen3.6的Claude Opus推理蒸馏+去审查版,直接提供GGUF量化,8GB显存可跑Q2_K版本,适合需要高质量、无审查限制的本地推理用户。
对位
对位 Gemma-2-27B
适合
复杂推理与多步逻辑 / 创意写作与无过滤对话
不适合
安全合规的生产环境

独立证据与社区反馈

8 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

Qwen3.6-27B 是首款能在单张 RTX 3090 上稳定运行且保持良好上下文长度的 27B 旗舰模型,Heretic 去审查版 KLD 极低(0.0021–0.0469)、拒绝率从 99% 降至 4–6%,NEO-Di-Matrix 量化在 Q4 仍保留 94% BF16 精度。编程综合表现超过 Qwen3.5-397B,但偶有循环、过度使用 emoji,且 NVFP4/MTP 量化在 agent 和高温场景下存在稳定性问题。

  • 单张 RTX 3090 即可运行 27B 模型并保持良好上下文长度
  • Heretic 去审查将拒绝率从 99/100 降至 4–6/100,KLD 仅 0.0021–0.0469,几乎不影响模型能力
  • NEO IMATRIX 编码使量化精度比标准 GGUF 提升 2–4%
  • Q4/IQ4s 量化保留 BF16 的 94% 性能,Q6 接近 98%,IQ2_M 仍达 83%
  • Q4_K_S 量化在 RTX 5090 上可达 75 t/s 稳定输出
  • MTP 多 token 预测变体在温度=1.0 固定设置下可超 90 t/s
  • 所有量化等级下输出张量保持 16-bit 全精度
  • 相比 Qwen3.5-397B,在 SWE-bench Verified(77.2 vs 76.2)和 Terminal-Bench 2.0(59.3 vs 52.5)等编程基准上全面领先
  • 27B 在实际项目编程中比 35B 更直观,能主动提出澄清性问题
  • 支持 256k 上下文窗口
  • Dense 架构比 MoE 更易于本地部署和推理
  • 偶尔会陷入输出循环
  • 会过度使用 emoji,需要显式提醒禁用
  • 仍有 4/100 的残留拒绝行为,边界情况行为不可预测,建议在部署前针对具体领域测试
  • NVFP4 量化在 agent 模式存在循环问题,编码场景建议使用 FP8
  • MTP 变体在 temperature > 1.0 或 repetition penalty > 1.0 时性能显著下降,不适用于需要调温的创意写作
  • 27B 推理速度明显慢于 35B-A3B(单会话约 28–33 t/s vs 350+ t/s)
  • head-to-head 实测中 Heretic NEO Code 版速度与基础版几乎持平(24.57 vs 24.34 t/s),性能提升感知有限
  • NVFP4 虽然 MMLU 总分尚可,但在 agent 长链路任务中会遗漏步骤,总体基准无法反映实际编码会话中的长尾失败

可信度基准 ARC +1.8%, BoolQ 持平; 拒绝率从 98/100 降至 8/100

完整规格

规模
27B · 256K · 权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 Qwen3.6-27B-Claude-Opus-Reasoning-Distill-v2-heretic
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 372 → 1k

观测时间线