SummFlow 2026-06-07 Hugging Face

Qwen3.6-27B-OptiQ-4bit (mlx-community)

Apple Silicon的Qwen3.6-27B 4bit混合量化版

  • Apple Silicon
  • 已量化
入选理由
基于Qwen3.6-27B的混合精度4-bit量化版,对Apple Silicon优化,性能略优于均匀4bit,提供OpenAI兼容接口,适合Mac用户本地部署。
对位
均匀4-bit量化版Qwen3.6-27B
适合
Apple Silicon本地推理 / 代码/工具调用/Agent
不适合
非Apple Silicon设备
规模
27B · 未知 · Q4 ~18GB / FP16 ~65GB
授权
Apache-2.0 · 可商用
框架
mlx-lm / mlx-optiq
血统
量化自 Qwen3.6-27B
可信度
下载量16k+,赞27,六项基准超越均匀4-bit,含MTP加速

仅 safetensors · 无 pickle 加载风险

社区实测

OptiQ 混合精度量化在几乎不增加体积的前提下全面优于统一 4-bit,是 Mac 上跑 Qwen3.6-27B 的优选方案;模型在 Apple Silicon 上仅需约 17–20 GB 内存即可运行,本地编程能力被社区认为可对标 Claude Code。但 mlx-optiq 框架的开发者身份不透明,部分用户对其可信度存疑。

  • OptiQ 混合精度在各项基准上均优于统一 4-bit,磁盘体积仅增加约 5%
  • 在 M4 (10核) 32GB Mac 上 1k 上下文可达 5.8 tok/s,峰值内存仅 17 GB
  • Qwen3.6-27B 的本地编程能力被多位用户认为可对标 Claude Code
  • MLX 的上下文缓存机制使长对话中响应近乎即时
  • 敏感层自动上浮至 8-bit、鲁棒层保持 4-bit,无需手动调参
  • MLX 格式在编程等重度上下文任务中显著优于 GGUF
  • 模型仅需约 20 GB 内存,在消费级 Mac 上即可运行
  • mlx-optiq 量化框架的开发者身份不明,社区对其可信度存在疑虑
  • MLX 在 LM Studio 中的提示缓存当前已损坏,与量化来源无关
  • GGUF 格式在高上下文窗口下即使在 M5 上仍可能导致系统冻结
  • 32 GB 统一内存是流畅运行的最低要求
  • SVG/图像生成质量不稳定,某些场景下不如 GLM 5.1 等竞品
  • OptiQ 虽开源但代码仅通过 PyPI 分发,仓库和开发过程不透明

截至 2026-06-21

快速上手

mlx_lm.load('mlx-community/Qwen3.6-27B-OptiQ-4bit')