SummFlow 2026-05-19 Hugging Face

Qwen3.6-35B-A3B-GGUF (Unsloth)

支持MTP加速的3B激活参数量化视觉语言模型,面向本地编程代理

入选理由
GGUF 格式可直接用 llama.cpp 部署,下载量 23 万+,是 Qwen3.6 量化版,非新能力。
对位
对位 Qwen3.5-35B-A3B、Gemma4-26B-A4B
适合
本地多模态推理与编程代理 (MTP加速) / 视觉问答、文档理解与工具调用
不适合
要求原始精度的量化敏感场景
规模
35B (3B active, Q4_K_XL) · 262k (可扩展至1M)
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama / Unsloth Studio
血统
量化自 Qwen3.6-35B-A3B
可信度
HuggingFace 23.7万下载,Qwen官方Apache-2.0,Unsloth提供原生MTP GGUF量化

社区实测

社区普遍认为这是 Qwen3.5 的明显升级,工具调用能力在低比特量化下依然出色,Unsloth 的 Dynamic 量化质量在同类 GGUFs 中排名靠前,适合消费级硬件本地部署;但在纯 CPU 场景下推理速度可能比部分其他来源的 GGUF 慢约 30%。

  • 2-bit 量化即可完成 30+ 次工具调用、搜索 20 个站点并执行 Python 代码,仅需 13GB RAM
  • 1-bit GGUF 的工具调用表现依然很好
  • SVG 绘图质量在特定场景下可媲美甚至超过 Claude Opus 4.7
  • 开放式探索搜索任务相比 Qwen3.5 有明显提升
  • Unsloth Dynamic 量化在 KL 散度基准上达到 SOTA(99.9%),覆盖编码、聊天、工具调用、科学、非拉丁文字等场景
  • 支持广泛的推理框架(llama.cpp、vLLM、SGLang、LM Studio、Docker Model Runner 等)
  • 可在 RTX 4060 8GB 显存上运行并获得不错的评估结果
  • 纯 CPU 推理时 Unsloth GGUF 比同等大小的其他来源 GGUF 慢约 30%,后续响应处理时间也更长
  • 量化模型中存在 ssm_conv1d 张量漂移问题
  • SVG 细节仍有瑕疵(如火烈鸟坐在轮胎上而非车座上)
  • 不同用户的体验差异较大

截至 2026-06-21

快速上手

llama-server -hf unsloth/Qwen3.6-35B-A3B-MTP-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 6