模型 / Qwen3.6-27B-OptiQ-4bit (mlx-community)

Qwen3.6-27B-OptiQ-4bit (mlx-community)

Apple Silicon的Qwen3.6-27B 4bit混合量化版

作者 mlx-community

仓库标识mlx-community/Qwen3.6-27B-OptiQ-4bit

显存未知许可 可商用任务 文本生成最近核对 2026-08-09
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
OPTIQ
下载
16,228

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

optiq serve --model mlx-community/Qwen3.6-27B-OptiQ-4bit --mtp

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
基于Qwen3.6-27B的混合精度4-bit量化版,对Apple Silicon优化,性能略优于均匀4bit,提供OpenAI兼容接口,适合Mac用户本地部署。
对位
均匀4-bit量化版Qwen3.6-27B
适合
Apple Silicon本地推理 / 代码/工具调用/Agent
不适合
非Apple Silicon设备

独立证据与社区反馈

12 个独立来源 · 另 2 官方/转载最近验证 2026-08-09

OptiQ-4bit 是 mlx-community 针对 Qwen3.6-27B 的混合精度量化(部分层保留 8bit、部分 4bit),官方称在相同磁盘体积下全面优于均匀 4bit,社区量化讨论中也常把它列为优先尝试对象。底层 Qwen3.6-27B 口碑普遍认可:27B 密集模型被视为本地旗舰,编程/agentic 编码能力超过前代 397B MoE,SWE-bench Verified 77.2%,约 20GB 内存即可部署,被认为是本地开发的甜点位。速度在 Apple silicon 上约 17-18 token/s(M1 Ultra)或接近 30 token/s,llama.cpp 在部分场景反而更快,整体性价比突出,但约 20GB 的内存门槛与配套工具稳定性仍需留意。

  • 本地跑旗舰级编码模型:27B 密集模型仅需约 20GB 内存,32GB 的机器即可流畅运行
  • 同体积下量化质量优于均匀 4bit:混合精度让部分层保持 8bit,官方六指标能力评分全面胜出
  • 离线 agentic 编程:SWE-bench Verified 77.2%,超过前代 397B MoE,Terminal-Bench 可对标 Claude 4.5 Opus
  • Apple silicon 上直接走 MLX 生态:mlx_lm 一键加载,免去手动换算量化格式
  • 预算有限的本地部署:$800 消费级 GPU 也能跑起来
  • 生成速度可用:约 30 token/s 已接近前沿 API 的水平
  • 量化选型无需转 GGUF:类似 unsloth 的混合精度思路,但原生兼容 MLX
  • OptiQ 系列有实测背书:有用户实测称 OptiQ 量化“极其好”
  • 内存门槛约 20GB 起步,并非任意配置都能跑;双 16GB 卡也不一定够
  • MLX 不总是最快的推理后端,llama.cpp 在部分场景反而更快
  • 密集 27B 生成速度明显低于稀疏 35B-A3B(约 17-18 vs 52 token/s),速度敏感者应选 MoE 形态
  • 配套的 oMLX 客户端 UI 在下载或改设置时容易崩溃
  • 想用 MTP 功能时需转 llama.cpp/GGUF,MLX 侧缺 16bit 支持
  • 针对 Qwen3.6-27B-OptiQ-4bit 的独立第三方基准仍偏少,口碑多来自相邻量化与官方数据

可信度下载量16k+,赞27,六项基准超越均匀4-bit,含MTP加速

完整规格

规模
27B · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
Apache-2.0 · 可商用
框架
mlx-lm / mlx-optiq
血统
量化自 Qwen3.6-27B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 3.7k → 2.8k

观测时间线

模型家族

查看全部家族 →