Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
Apple Silicon 4-bit MLX混精量化+MTP投机解码
- Apple Silicon
- 已量化
仅 safetensors · 无 pickle 加载风险
社区实测
OptiQ 4-bit 混合精度量化在六项能力评分上全面超越同体积的均匀 4-bit 量化,磁盘占用仅多约 5%;Qwen3.6-35B-A3B 以 3B 激活参数在 SWE-bench Verified 拿下 73.4%,被社区视为本地编码场景的突破性 MoE 模型。MLX 生态下上下文缓存与编码任务表现明显优于 GGUF,但 mlx-optiq 框架的代码仓库与开发者归属仍不透明。
- 混合精度量化(敏感层 8-bit、鲁棒层 4-bit)在六项能力评分中全面超越同体积均匀 4-bit 量化
- SWE-bench Verified 得分 73.4%,仅激活约 3B 参数即可运行,可在本地笔记本部署
- MLX 上下文缓存使聊天历史增长时仍能近即时响应
- MLX 在上下文密集的编码任务上显著优于 GGUF
- 35B 模型容量仅需约 3B 计算开销,兼顾表达能力与推理速度
- 在 Mac Studio M3 上 4-bit 模型推理速度与输出质量表现惊人
- 支持通过 optiq serve --mtp 启用 Multi-Token Prediction 推理
- mlx-optiq 的代码仓库与开发者身份不明确,社区对其透明度存疑
- MLX 在 LM Studio 中的 prompt caching 目前处于损坏状态
- Mac 上流畅运行本地 LLM 需要至少 32GB 内存
mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit - Hugging FaceIs mlx-optiq legit? Has anyone tested the new quants for Gemma4 ...MLX vs GGUF: Ultimate Comparison - YouTubeQwen 3.5 for MLX is like its own industrial revolution - RedditMLX Downloading for Local Use - MLX Community VS Unsloth?Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally
截至 2026-06-21
快速上手
optiq serve --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit --mtp