模型 / Qwen3.6-35B-A3B-GGUF (Unsloth)

Qwen3.6-35B-A3B-GGUF (Unsloth)

35B MoE仅3B激活的GGUF量化版,适合本地中文开发

作者
unsloth
对位
对位 Mixtral-8x7B 与 Llama-3-70B 混合专家模型
适合
本地中文对话与代码补全 / 低内存占用(3B激活)的MoE推理
不适合
复杂数学或长链逻辑推理
入选理由
GGUF格式可直接用LM Studio/Ollama运行,下载量超50万表明社区认可,但仅为量化重打包,非新模型。
规模
35B (3B 激活) · 262k (可扩展至1M) · 最低 ~21GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 Qwen3.6-35B-A3B
国内访问
需代理
可信度
HuggingFace下载52.5万次,Qwen官方训练,LM Studio量化发布

社区实测

稀疏 MoE 架构(35B 总参/3B 激活)以极低推理成本在消费级硬件上运行,Agentic Coding 和 SWE-bench 等基准表现亮眼,Apache 2.0 许可对开发者友好;但实际编程体验两极分化——速度快却输出质量不稳定,密集 27B 版本在需要规划的任务上口碑更佳,与前沿闭源模型仍有明显差距。

  • 在消费级硬件(MacBook Pro M5)上可运行 Q4 量化版本,部署门槛低
  • Terminal-Bench 2.0 得分 24.6%,超越 Gemini 2.5 Pro(19.6%),开源模型中领先
  • Apache 2.0 许可,允许商用,无使用限制
  • MoE 仅激活 3B 参数,推理响应速度快,适合日常快速问答
  • SWE-bench Verified 得分 73.4%,远超 Gemma 4-31B(52.0%)
  • 在 agentic coding 场景下实际可用,能胜任约 90% 的日常任务
  • 支持多模态输入(视觉编码器),可处理图像生成类任务
  • 在与 Gemma 4 26B A4B 的编程对比测试中以 21 分优势胜出
  • 在 agentic coding 中会出现无限循环重复同一操作(如反复以空字符串调用写文件函数)
  • 代码生成质量不稳定,输出可能松散凌乱,不如密集 27B 版本干净一致
  • Power Ranking 编程任务仅解决 11/98,相比 Qwen3.5 35B(10/98)提升极小
  • 知识类 benchmark 表现明显弱于预期,存在「刷榜」嫌疑
  • 对 harness 和推理参数(temperature 等)敏感,配置不当严重影响效果
  • 密集 27B 版本在需要规划和结构的任务上明显更优,社区多人中途切换回 27B
  • 与 Claude Opus 4.7 等前沿闭源模型在编程 benchmark 上差距仍大(Opus 95/98 vs 11/98)
  • 使用超出推荐数量的 expert 会导致输出质量下降

截至 2026-06-21

本形态 ~21GB 4-bit · 国内 需代理 · 2,569,052 下载

快速上手

ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF

本形态源 ↗

下载动量

30天下载 844.6k → 750.8k · likes +112

观测时间线

模型家族

查看全部家族 →