模型 / Qwen3.6-27B-MTPLX (Youssofal)

Qwen3.6-27B-MTPLX (Youssofal)

Qwen3.6-27B 的 MLX 推理加速版供苹果芯片

作者
Youssofal
对位
替代 Qwen3.6-27B 传统 MLX 推理
适合
Apple Silicon 本地代码生成 / 低延迟对话应用
不适合
非苹果芯片设备
入选理由
Qwen3.6-27B的MLX 4-bit量化版,专为Apple Silicon优化,通过MTPLX实现推测解码加速(2.24x),提供命令行和兼容API,适合在苹果M系列设备上快速部署。
规模
27B · 最低 ~16GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
mlx / mtplx
国内访问
需代理
可信度
HF下载量44k+,M5 Max 上 temp=0.6 实测 63 tok/s

社区实测

Qwen3.6-27B 被社区公认为同规模中编码能力最强的密集模型,SWE-bench 甚至超过自家 35B MoE;MTPLX 在 Apple Silicon 上实现 2×+ 解码加速且无损质量,使其成为首个让用户愿意用于实际工作的本地模型。但长上下文 OOM 和部分场景下输出质量波动仍是短板。

  • 旗舰级编码能力可本地运行:SWE-bench 77.2%,超过 35B-A3B 的 73.4%
  • 无 MoE 的 VRAM 开销,Q4_K_M 约 15.7 GB 即可装入 24GB 显存
  • MTPLX 在 Apple Silicon 上实现 2.24× 解码加速,无外部 drafter、无额外 RAM、无质量损失
  • MTPLX 提供一键式部署:自动检测硬件、推荐模型、下载、配置环境
  • 适合作为本地编码代理,用户反馈 OpenClaw 配合使用效果良好
  • 同时提供 Optimized-Speed (4-bit) 和 Optimized-Quality (8-bit) 两种版本
  • 原生支持 262k 上下文,可经 YaRN 扩展至 1,010,000 tokens
  • 上下文超过约 65k 时出现 OOM
  • MTP 模式下代码质量可能不如使用独立 draft model (Qwen3.5-0.8B)
  • SVG 生成效果不佳,与 GLM 5.1 相比明显偏弱
  • 数学能力弱于 35B-A3B (AIME 87.8 vs 92.7)
  • MTPLX v0.1.0-preview 仅支持 Qwen3-Next-MTP,兼容范围有限
  • 即使是 4-bit 量化仍需约 20GB 内存,对 16GB 设备仍有门槛

截至 2026-06-21

本形态 ~16GB 4-bit · 国内 需代理 · 44,544 下载

仅 safetensors · 无 pickle 加载风险

快速上手

brew install youssofal/mtplx/mtplx

本形态源 ↗

下载动量

30天下载 20.2k → 18k · likes +8

观测时间线