模型 / Qwen3.6-27B-MTPLX (Youssofal)

Qwen3.6-27B-MTPLX (Youssofal)

Qwen3.6-27B 的 MLX 推理加速版供苹果芯片

作者 Youssofal

仓库标识Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed

~16GB 4-bit许可 可商用任务 文本生成最近核对 2026-08-09
格式
4-bit
文件
~14GB
运行内存
~16GB–21GB
运行时
MTPLX
下载
44,544

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mtplx serve --model Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Qwen3.6-27B的MLX 4-bit量化版,专为Apple Silicon优化,通过MTPLX实现推测解码加速(2.24x),提供命令行和兼容API,适合在苹果M系列设备上快速部署。
对位
替代 Qwen3.6-27B 传统 MLX 推理
适合
Apple Silicon 本地代码生成 / 低延迟对话应用
不适合
非苹果芯片设备

独立证据与社区反馈

13 个独立来源最近验证 2026-08-09

Qwen3.6-27B 被社区普遍视为本地开发/部署的甜点位,而 Youssofal/Qwen3.6-27B-MTPLX-Optimized-Speed 是 Apple Silicon 上跑它的主流选择:在 oMLX 下载器中下载量和星数都最高,基线 24.7 t/s,比 LMStudio 下 mlx-community 的 4bit 版本快约 29%,M3 Ultra 上 v2 Optimized Speed 更被实测到 82.8 t/s。编程能力被反复验证能压过 397B 的 MoE 旗舰(SWE-bench Verified 77.2%),同时 Q4_K_M 只要 16-18GB 显存就能跑,性价比突出;不做推理时的社区口碑是「qwen 27b 就是最好的」,但也有「探索代码库/制定计划偏弱、比 Claude 更较劲」的明确差评。

  • Apple Silicon 上最快的 Qwen3.6-27B 跑法之一:基线 24.7 t/s,比 LMStudio 下 mlx-community 4bit(17.5 t/s)快约 29%、比其另一档(15.4 t/s)快约 37%
  • M 系列 MacBook 上可达 63 tok/s,MLX 原生 MTP 运行时,是 27B 独有的强 MLX 支持
  • M3 Ultra + MTPLX v2 Optimized Speed 上被实测到 82.8 t/s
  • 低显存门槛:Q4_K_M 只需 16.88GB VRAM,官方宣传也能跑在 18GB VRAM 上
  • 密集架构使 MTP 头开销仅约 1GB,实现与部署比 MoE 简单
  • 量化取舍成熟:Q4_K_M 保留约 96% 精度、2.3x 速度、一半内存,量化收益明显
  • 旗舰级编程表现:SWE-bench Verified 77.2% 超过 397B MoE,Terminal-Bench 匹配 Claude 4.5 Opus
  • 在 oMLX 下载器里下载量与星数领先,是社区默认推荐而不是需要解释的选择
  • 受 llama.cpp MTP 机制限制:不支持 -np > 1 并行,不支持 --mmproj
  • 依赖 llama.cpp PR #22673,对推理框架版本有硬性要求
  • agentic 编码强但探索/理解整个代码库、制定计划偏弱,这类任务需要搭配能吞下全上下文的模型
  • 使用体验比 Claude 更「较劲」,需要逐步人工引导才出彩
  • 多模态与 grounded 任务排名靠后:34 个候选模型里排第 24,54.1/100
  • IQ4_XS 量化有已知坑:此前 llama.cpp 的 bug 让 IQ4_XS 量化体积偏大,16GB 显存场景建议用 llama-quantize 默认参数、不要加 --pure

可信度HF下载量44k+,M5 Max 上 temp=0.6 实测 63 tok/s

完整规格

规模
27B · 下载 ~14GB · 显存最低 ~16GB · 推荐 ~21GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
mlx / mtplx
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 4.9k → 3.2k · likes +1

观测时间线