Qwen3.6-35B-A3B-VQ (aquaman164)
MLX VQ量化35B MoE,适合Apple Silicon本地推理
- 入选理由
- Qwen3.6-35B-A3B的向量量化版,同尺寸下PPL优于标量量化;需在Apple Silicon上运行自定义Metal内核,提供OpenAI兼容API,适合Mac用户自部署.
- 对位
- 对位3B级密集模型
- 适合
- 本地日常对话与文本生成 / 资源受限的Apple设备推理
- 不适合
- 云端大规模部署或高精度任务
- 规模
- 35B (3B激活) · 128k · Q4 ~23GB / FP16 ~84GB
- 授权
- Apache-2.0 · 需自查
- 框架
- mlx
- 血统
- 量化自 Qwen3.6-35B-A3B
- 可信度
- 首个Apple Silicon上trained-codebook VQ模型,11.53GB,实测66 tok/s
仅 safetensors · 无 pickle 加载风险
快速上手
huggingface-cli download aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw --local-dir qwen-vq && python qwen-vq/code/vq_serve.py --model qwen-vq 点击复制