模型 / Qwen3.6-27B Omnimerge v4 MTP (ManniX-ITA)

Qwen3.6-27B Omnimerge v4 MTP (ManniX-ITA)

带 MTP 自推测解码的 GGUF 量化版,加速本地推理

作者 ManniX-ITA

仓库标识ManniX-ITA/Qwen3.6-27B-Omnimerge-v4-MTP-GGUF

~16GB 4-bit许可 可商用最近核对 2026-08-06
格式
4-bit
文件
~14GB
运行内存
~16GB–21GB
运行时
LLAMA-SERVER
下载
4,608

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf ManniX-ITA/Qwen3.6-27B-Omnimerge-v4-MTP-GGUF -m Qwen3.6-27B-Omnimerge-v4-Q6_K.gguf --spec-type draft-mtp --spec-draft-n-max 3 -ngl 99 -c 16384

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Qwen3.6-27B 合并模型的 GGUF,保留 MTP 头,llama.cpp 上可自推测解码,吞吐约2倍。适合 24GB 显存、用最新 llama.cpp 的本地推理用户。
对位
对位 Qwen3.6-27B 基座模型
适合
代码生成 (HumanEval 83.5%) / 长文本 CoT 推理加速 (2x)
不适合
视觉多模态任务 (MTP 未验证)

完整规格

规模
27B · 128k · 下载 ~14GB · 显存最低 ~16GB · 推荐 ~21GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 Qwen3.6-27B-Omnimerge-v4
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 4.8k → 4.5k

观测时间线