SummFlow 2026-05-18 Hugging Face

Qwen3.6-35B-A3B-GGUF (Unsloth)

Qwen3.6 MoE GGUF 量化版,用于本地代理编程与多模态推理

入选理由
GGUF 格式支持 Ollama 快速部署,下载量 256 万表明广泛使用;但仅为原模型量化版,无新增能力。
对位
替代 Qwen3.5-35B-A3B 与 Gemma4-26BA4B
适合
Agentic 编码与 SWE-bench 任务 / 多模态视觉理解与文档分析
不适合
不适合微调及高精度科学计算
规模
35B (3B 激活 MoE) · 262k (可扩展至 1M)
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 Qwen3.6-35B-A3B
可信度
下载量 2.57M,点赞 1052,SWE-bench Verified 得分 73.4

社区实测

社区普遍认为 Qwen3.6-35B-A3B 是当前性价比极高的本地部署旗舰模型,即使在 2-bit 极低量化下工具调用和创意生成依然可靠,相比 Qwen3.5 有明显提升;但 Unsloth 版 GGUF 在纯 CPU 场景下速度偏慢,且不同用户体感差异较大。

  • 2-bit 量化即可在仅 13GB 内存下完成 30+ 次工具调用、搜索 20 个站点并执行 Python 代码,大幅降低本地 agent 部署门槛
  • 1-bit 量化下工具调用依然正常工作,极端压缩场景仍保持可用性
  • SVG/图像生成质量在部分测试中优于 Claude Opus 4.7,笔记本上跑出比云端旗舰更好的结果
  • 相比 Qwen3.5 在开放式 agent 任务(如 wiki 探索、自动建库)中有明显提升
  • 可在 RTX 4060 8GB VRAM 等消费级显卡上运行
  • 支持 llama.cpp、vLLM、SGLang、LM Studio、Unsloth Studio、Docker 等广泛生态
  • Unsloth Dynamic 2.0 量化使用真实场景数据集校准并对关键层进行上采样,在 22 个模型尺寸中 21 个排名第一
  • Unsloth 版 GGUF 在纯 CPU 场景下比同类尺寸的其他来源 GGUF 慢约 30%,后续响应处理时间也更长
  • 量化 GGUF 存在 ssm_conv1d 张量漂移问题,需通过 Wasserstein 度量等特殊手段修复
  • 不同用户的实际体验差异较大,并非在所有场景下都优于 Grok 等竞品

截至 2026-06-21

快速上手

ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF