模型 / Qwen3.6-35B-A3B-GGUF (Unsloth)

Qwen3.6-35B-A3B-GGUF (Unsloth)

35B MoE仅3B激活的GGUF量化版,适合本地中文开发

作者 unsloth

仓库标识unsloth/Qwen3.6-35B-A3B-GGUF

显存未知许可 可商用任务 视觉理解最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
OLLAMA
下载
2,569,052

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/unsloth/Qwen3.6-35B-A3B-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
GGUF格式可直接用LM Studio/Ollama运行,下载量超50万表明社区认可,但仅为量化重打包,非新模型。
对位
对位 Mixtral-8x7B 与 Llama-3-70B 混合专家模型
适合
本地中文对话与代码补全 / 低内存占用(3B激活)的MoE推理
不适合
复杂数学或长链逻辑推理

独立证据与社区反馈

10 个独立来源 · 另 2 官方/转载最近验证 2026-08-09

本地社区整体口碑正面但看法分层:Qwen3.6-35B-A3B 的 Unsloth GGUF 能在 24GB 消费级显卡(3090 Ti/5090)上流畅跑代码任务,配上 MTP 速度可达 ~50 tok/s,量化质量也被认为明显优于前代 Qwen3.5;但同时存在反复被吐槽的点——thinking 模式接代码解释器时经常只写代码不输出、Q8 档在基准上反而不如 Qwen3.5,且同一显存下速度弱于部分第三方量化,不同厂商的量化之间差异不小。

  • 本地代码任务在 24GB 显存(3090 Ti、5070 Ti 等)上即可流畅运行,体验接近云端旗舰
  • MTP 带来明显提速,单机即可从 ~27 tok/s 提到 ~50 tok/s,低比特量化也能获得 1.4 倍以上加速
  • 2-bit 这类低比特量化仍保持可用,有人用 2-bit 量化连续成功完成 30+ 次工具调用
  • 量化质量优于前代 Qwen3.5 35B A3B,压缩损失更小
  • 支持 Developer Role,可直接用于 Codex、OpenCode 等
  • 可跑到约 200k 上下文,Q5 档位被不少用户视为性价比甜点位
  • 在只有 64GB 内存、无大显存的机器上也能以 9.5-10 tok/s 运行
  • 多档量化可选,Q4 在部分基准实测中观感质量最高
  • thinking 模式下配合代码解释器时经常只写完代码就停止、不出最终输出(非 thinking 模式正常)
  • Q8_K_XL 档在基准上表现令人失望:解出的测试更少、报错更多,反不如 Qwen3.5
  • Q3 档位被用户认为不够可靠
  • 同硬件下速度弱于部分第三方量化(实测 23 TK/sec vs 30 TK/sec)
  • 推理速度仍明显慢于 Claude Sonnet 4.6
  • 知识储备不如更大的 Qwen3 Next 80B,做离线知识库时差距明显
  • 不同厂商量化的质量/速度差异大,ByteShape 声称其量化更快更小且保留更多基准分
  • 在相同设置下不同量化的失败表现各不相同,质量以观感为准

可信度HuggingFace下载52.5万次,Qwen官方训练,LM Studio量化发布

完整规格

规模
35B (3B 激活) · 262k (可扩展至1M) · 权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 Qwen3.6-35B-A3B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1284.1k → 1268.1k · likes +63

观测时间线

模型家族

查看全部家族 →