Qwen3.6-27B Omnimerge v4 MTP (ManniX-ITA)
带 MTP 自推测解码的 GGUF 量化版,加速本地推理
- 入选理由
- Qwen3.6-27B 合并模型的 GGUF,保留 MTP 头,llama.cpp 上可自推测解码,吞吐约2倍。适合 24GB 显存、用最新 llama.cpp 的本地推理用户。
- 对位
- 对位 Qwen3.6-27B 基座模型
- 适合
- 代码生成 (HumanEval 83.5%) / 长文本 CoT 推理加速 (2x)
- 不适合
- 视觉多模态任务 (MTP 未验证)
- 规模
- 27B · 128k · Q4 ~18GB / FP16 ~65GB
- 授权
- apache-2.0 · 需自查
- 框架
- llama.cpp / ollama
- 血统
- 量化自 Qwen3.6-27B-Omnimerge-v4
- 可信度
- 4600+ 下载,HumanEval 83.54% 与基座一致,MTP 推理吞吐 2x
快速上手示例
llama-server -hf ManniX-ITA/Qwen3.6-27B-Omnimerge-v4-MTP-GGUF -m Qwen3.6-27B-Omnimerge-v4-Q6_K.gguf --spec-type draft-mtp --spec-draft-n-max 3 -ngl 99 -c 16384 点击复制
依赖版本和硬件参数请以源仓库说明为准。