Qwen3.6-27B-MTPLX (Youssofal)
Qwen3.6-27B 的 MLX 推理加速版供苹果芯片
社区实测
Qwen3.6-27B 被社区公认为同规模中编码能力最强的密集模型,SWE-bench 甚至超过自家 35B MoE;MTPLX 在 Apple Silicon 上实现 2×+ 解码加速且无损质量,使其成为首个让用户愿意用于实际工作的本地模型。但长上下文 OOM 和部分场景下输出质量波动仍是短板。
- 旗舰级编码能力可本地运行:SWE-bench 77.2%,超过 35B-A3B 的 73.4%
- 无 MoE 的 VRAM 开销,Q4_K_M 约 15.7 GB 即可装入 24GB 显存
- MTPLX 在 Apple Silicon 上实现 2.24× 解码加速,无外部 drafter、无额外 RAM、无质量损失
- MTPLX 提供一键式部署:自动检测硬件、推荐模型、下载、配置环境
- 适合作为本地编码代理,用户反馈 OpenClaw 配合使用效果良好
- 同时提供 Optimized-Speed (4-bit) 和 Optimized-Quality (8-bit) 两种版本
- 原生支持 262k 上下文,可经 YaRN 扩展至 1,010,000 tokens
- 上下文超过约 65k 时出现 OOM
- MTP 模式下代码质量可能不如使用独立 draft model (Qwen3.5-0.8B)
- SVG 生成效果不佳,与 GLM 5.1 相比明显偏弱
- 数学能力弱于 35B-A3B (AIME 87.8 vs 92.7)
- MTPLX v0.1.0-preview 仅支持 Qwen3-Next-MTP,兼容范围有限
- 即使是 4-bit 量化仍需约 20GB 内存,对 16GB 设备仍有门槛
Qwen3.6-27B: MTP + Optimized KV cache? : r/oMLX - RedditQwen3.6 27B really good? : r/LocalLLaMA - RedditMTPLX V1: The Swift App For Running & Creating MLX MTP Models ...Wow, Qwen3.6-27B is good : r/LocalLLM - RedditQwen3.6-27B Community Variants — The Definitive Guide ... - RedditQwen3.6-27B: Flagship-Level Coding in a 27B Dense Model | Hacker NewsQwen3.6-27B MTP inferior to draft-model 3.5-0.8B? - RedditYoussof Altoukhi (@Youssofal_) on XGitHub - youssofal/MTPLX: 2.24x decode TPS increase On Qwen 3.6 27B @ temp 0.6 | Native MTP Speculative Decoding On Apple Silicon With No External Drafter. · GitHubYoussofal/Qwen3.6-27B-MTPLX-Optimized-Speed - Hugging FaceMTPLX Is 2.04× Faster Than MLX — But Is It Really Usable?Run Qwen3.6 27B 2x Faster on M5 Max — Native MTP ...Youssofal/Qwen3.6-27B-MTPLX-Optimized-Quality · Hugging Face
截至 2026-06-21
本形态 ~16GB 4-bit · 国内 需代理 · 44,544 下载
仅 safetensors · 无 pickle 加载风险
快速上手
brew install youssofal/mtplx/mtplx