SummFlow 2026-07-14 Hugging Face

Qwen3.6-35B-A3B-VQ (aquaman164)

MLX VQ量化35B MoE,适合Apple Silicon本地推理

  • Apple Silicon
  • 已量化
入选理由
Qwen3.6-35B-A3B的向量量化版,同尺寸下PPL优于标量量化;需在Apple Silicon上运行自定义Metal内核,提供OpenAI兼容API,适合Mac用户自部署.
对位
对位3B级密集模型
适合
本地日常对话与文本生成 / 资源受限的Apple设备推理
不适合
云端大规模部署或高精度任务
规模
35B (3B激活) · 128k · Q4 ~23GB / FP16 ~84GB
授权
Apache-2.0 · 需自查
框架
mlx
血统
量化自 Qwen3.6-35B-A3B
可信度
首个Apple Silicon上trained-codebook VQ模型,11.53GB,实测66 tok/s

仅 safetensors · 无 pickle 加载风险

快速上手

huggingface-cli download aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw --local-dir qwen-vq && python qwen-vq/code/vq_serve.py --model qwen-vq