SummFlow 2026-06-07 Hugging Face

Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)

Apple Silicon 4-bit MLX混精量化+MTP投机解码

  • Apple Silicon
  • 已量化
入选理由
针对Apple Silicon的混合精度量化版Qwen3.6 MoE,4bit/8bit混合,长上下文检索提升8%,适合苹果设备快速部署大模型。
对位
对位uniform-4bit MLX量化
适合
Apple Silicon本地推理 / 代码/Agent/约束指令
不适合
非Apple Silicon平台
规模
35B-A3B · 未知 · Q4 ~23GB / FP16 ~83GB
授权
Apache-2.0 · 可商用
框架
mlx / mlx-optiq
血统
量化自 Qwen3.6-35B-A3B
可信度
6项基准均分76.78, 超uniform-4bit 1.12, MTP加速1.4×

仅 safetensors · 无 pickle 加载风险

社区实测

OptiQ 4-bit 混合精度量化在六项能力评分上全面超越同体积的均匀 4-bit 量化,磁盘占用仅多约 5%;Qwen3.6-35B-A3B 以 3B 激活参数在 SWE-bench Verified 拿下 73.4%,被社区视为本地编码场景的突破性 MoE 模型。MLX 生态下上下文缓存与编码任务表现明显优于 GGUF,但 mlx-optiq 框架的代码仓库与开发者归属仍不透明。

  • 混合精度量化(敏感层 8-bit、鲁棒层 4-bit)在六项能力评分中全面超越同体积均匀 4-bit 量化
  • SWE-bench Verified 得分 73.4%,仅激活约 3B 参数即可运行,可在本地笔记本部署
  • MLX 上下文缓存使聊天历史增长时仍能近即时响应
  • MLX 在上下文密集的编码任务上显著优于 GGUF
  • 35B 模型容量仅需约 3B 计算开销,兼顾表达能力与推理速度
  • 在 Mac Studio M3 上 4-bit 模型推理速度与输出质量表现惊人
  • 支持通过 optiq serve --mtp 启用 Multi-Token Prediction 推理
  • mlx-optiq 的代码仓库与开发者身份不明确,社区对其透明度存疑
  • MLX 在 LM Studio 中的 prompt caching 目前处于损坏状态
  • Mac 上流畅运行本地 LLM 需要至少 32GB 内存

截至 2026-06-21

快速上手

optiq serve --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit --mtp