模型 / Qwen3.6-35B-A3B (andreaborio)

Qwen3.6-35B-A3B (andreaborio)

Qwen3.6 MoE 量化版,Apple Metal 加速推理

作者 andreaborio

仓库标识andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF

显存未知许可 可商用任务 文本生成最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
OLLAMA
下载
102

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/andreaborio/Qwen3.6-35B-A3B-DS4-ExpertMajor-v1-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Qwen3.6-35B-A3B的GGUF量化版,含标准格式可直接用llama.cpp,苹果用户可试用作者优化版。仅量化重打包,无新能力。
对位
对位 Qwen2.5-3B (3B 激活)
适合
Apple Silicon 本地聊天 / 低内存 MoE 研究
不适合
非 Apple Metal 平台

独立证据与社区反馈

10 个独立来源最近验证 2026-08-05

在仅 3B 激活参数的前提下,编码能力超越多数同体量模型,被普遍视为当前性价比最高的本地编程模型。相比上一代 Qwen3.5-35B-A3B 和同期的 Gemma 4 26B 均有明显优势,但量化版本在复杂任务上存在质量损失,且需要正确配置 chat_template 才能充分发挥工具调用和推理能力。

  • 本地部署门槛低,仅需 16GB 内存的 Mac Mini 即可运行
  • 编码能力强,SWE-bench Verified 达到 73.4%,远超 Gemma 4 26B A4B 的 52.0%
  • 终端编程/Agent 任务表现突出,Terminal-Bench 2.0 得分 51.5
  • 相比 Qwen3.5-35B-A3B 在多项基准上有显著提升,幻觉率从 84.0% 降至 49.7%
  • Apache 2.0 开源协议,可在 Ollama、vLLM、MLX、Transformers 等框架开箱即用
  • 支持推测解码,消费级硬件上可实现最高 3 倍加速
  • 在个人基准测试中表现优于 Gemma4 26B A4B,输出更正确、更有用
  • 与 opencode 等编程 agent 配合良好
  • 量化版本(如 Q4KM)在复杂任务上质量下降明显,全精度版本更可靠
  • chat_template 配置不当会导致 thinking/reasoning/tool calling 异常
  • JSON 输出在特定场景下不可靠
  • 上下文增长后速度明显变慢
  • 量化版本的速度比 Gemma 4 26B A4B 略慢

可信度基于 Qwen 官方 Apache 2.0;Unsloth 量化;M5 Pro 实测 57.81 t/s

完整规格

规模
35B (3B 激活) · 权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / MLX / DS4
血统
量化自 Qwen3.6-35B-A3B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1.2k → 515

观测时间线

模型家族

查看全部家族 →