Qwen3.6-27B-GGUF (unsloth)
Qwen3.6-27B GGUF量化版,面向本地部署与边缘推理
社区实测
Qwen3.6-27B 被社区广泛认可为旗舰级编码模型,在多数编码基准上超越参数规模大得多的前代 MoE 模型;Unsloth 的 GGUF 量化配合 Dynamic 2.0 使其在本地部署门槛大幅降低,但因隐层维度比 Qwen3.5 增大约 20%,同硬件需降一档量化才能跑动;MTP 支持带来 2-2.5 倍吞吐提升,但依赖尚未合入主线的 llama.cpp PR。
- 27B 稠密模型在多数编码基准上超越 397B 参数的 MoE 前代模型
- Unsloth Dynamic 2.0 量化使用真实场景数据集校准并对关键层进行上采样,提升量化质量
- MTP 多 token 预测带来约 2.5 倍吞吐提升,草稿 token 接受率高
- 2-bit 量化仍可完成 26 次工具调用、分类 15 个 GitHub issue 并修复复现问题,12GB 内存即可运行
- 在 M5 Pro 上仅需约 20GB 内存即可运行 16.8GB 量化版本
- 稠密架构比 MoE 更容易本地部署
- 支持 llama.cpp、vLLM、SGLang、Unsloth Studio 等多种推理后端
- MTP 将本地 LLM 的讨论从「能不能跑」转向「是否快到能融入工作流」
- 隐层维度比 Qwen3.5 增大约 20%,同等硬件需降一档量化才能加载
- 数十种量化变体让新手选择困难,确定上下文窗口大小也需要反复试错
- Q4_K_XL 量化版本存在工具调用失败的问题
- MTP 依赖尚未合入主线的 llama.cpp PR #22673,需自行编译
- Q8_K_XL 在 M3 Ultra 集群上无 MTP 时仅约 30 tks
- 量化质量差异显著,Same Top P 高不代表模型内部概率分布稳定,需关注 Mean KLD
- SVG 图像生成质量与 GLM 5.1 等竞品相比不够稳定
Qwen3.6-27B beats much larger predecessor on most coding benchmarksQwen3.6 - How to Run Locally | Unsloth DocumentationQwen3.6-27B with MTP grafted on Unsloth UD XL - Reddit2-bit Qwen3.6-27B GGUF made 26 tool calls on 12GB RAM.Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model | Hacker Newsunsloth/Qwen3.6-27B-GGUF - Hugging FaceQwen3.6-27B-MTP-GGUF: Local LLMs Need Speed, Not Just ...unsloth Qwen3.6-27B-GGUF : r/LocalLLaMA - RedditYea, this is currently the confusing part of running local models for ...unsloth/Qwen3.6-27B-GGUF · DiscussionsRealistically what system do you need to run unsloth/Qwen3.6-27B ...Qwen3.6-27B Quantization Benchmark : r/LocalLLaMA
截至 2026-06-21
快速上手
llama.cpp: ./main -m Qwen3.6-27B-Q4_K_M.gguf