此页是 2026-05-18 的观测快照,查看该模型当前信息 → /m/unsloth__qwen36-27b-gguf/

归档 / 2026-05-18 / Qwen3.6-27B-GGUF (unsloth)

Qwen3.6-27B-GGUF (unsloth)

Qwen3.6-27B GGUF量化版,面向本地部署与边缘推理

入选理由
GGUF格式即用,下载量高但属量化重打包,无新增能力。
对位
对标 Qwen3-35B-A3B MoE 与 DeepSeek-Coder-V2
适合
本地代码智能体与工具调用 / 长上下文文档分析及问答
不适合
依赖全精度浮点的科研场景
规模
27B · 262K
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 Qwen3.6-27B
可信度
HuggingFace下载量184万+,源自Apache-2.0许可的Qwen3.6-27B

社区实测

Qwen3.6-27B 被社区广泛认可为旗舰级编码模型,在多数编码基准上超越参数规模大得多的前代 MoE 模型;Unsloth 的 GGUF 量化配合 Dynamic 2.0 使其在本地部署门槛大幅降低,但因隐层维度比 Qwen3.5 增大约 20%,同硬件需降一档量化才能跑动;MTP 支持带来 2-2.5 倍吞吐提升,但依赖尚未合入主线的 llama.cpp PR。

  • 27B 稠密模型在多数编码基准上超越 397B 参数的 MoE 前代模型
  • Unsloth Dynamic 2.0 量化使用真实场景数据集校准并对关键层进行上采样,提升量化质量
  • MTP 多 token 预测带来约 2.5 倍吞吐提升,草稿 token 接受率高
  • 2-bit 量化仍可完成 26 次工具调用、分类 15 个 GitHub issue 并修复复现问题,12GB 内存即可运行
  • 在 M5 Pro 上仅需约 20GB 内存即可运行 16.8GB 量化版本
  • 稠密架构比 MoE 更容易本地部署
  • 支持 llama.cpp、vLLM、SGLang、Unsloth Studio 等多种推理后端
  • MTP 将本地 LLM 的讨论从「能不能跑」转向「是否快到能融入工作流」
  • 隐层维度比 Qwen3.5 增大约 20%,同等硬件需降一档量化才能加载
  • 数十种量化变体让新手选择困难,确定上下文窗口大小也需要反复试错
  • Q4_K_XL 量化版本存在工具调用失败的问题
  • MTP 依赖尚未合入主线的 llama.cpp PR #22673,需自行编译
  • Q8_K_XL 在 M3 Ultra 集群上无 MTP 时仅约 30 tks
  • 量化质量差异显著,Same Top P 高不代表模型内部概率分布稳定,需关注 Mean KLD
  • SVG 图像生成质量与 GLM 5.1 等竞品相比不够稳定

截至 2026-06-21

快速上手

llama.cpp: ./main -m Qwen3.6-27B-Q4_K_M.gguf

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   1 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-05-18)

作者
unsloth
任务类型
image-text-to-text
推理库
transformers
下载
1,845,912
点赞
692
许可证
Apache-2.0
标签
transformers, gguf, unsloth, qwen, qwen3_5, image-text-to-text, base_model:Qwen/Qwen3.6-27B, base_model:quantized:Qwen/Qwen3.6-27B, license:apache-2.0, endpoints_compatible, region:us, imatrix, conversational

探索

源链接