Qwen3.5-9B-OptiQ-4bit (mlx-community)
Apple Silicon 本地 4-bit 混合精度量化文本生成模型
社区实测
Qwen3.5-9B MLX 4bit 在 Apple Silicon 上速度与质量平衡出色,OptiQ 混合精度量化在同等磁盘占用下全面优于统一 4-bit 量化。社区实测 106 t/s 生成速度、71% 综合评分,工具调用 83% 表现出色,但推理和编程能力相对偏弱,MLX 多轮对话性能也低于 GGUF。
- OptiQ 混合精度量化在同等磁盘占用下,六项基准测试全面优于统一 4-bit 量化
- 生成速度快,M3 Ultra 上达 106 t/s
- 内存占用低,仅约 5 GB 运行时 / 7.7-8.4 GB 峰值
- 提示处理速度极快,M5 Pro 上 4k 上下文达 1,539 tok/s
- 相比 Llama 3 405B 同任务从约 500s 降到约 30s
- 工具调用能力突出,基准测试得分 83%
- Qwen 系列模型对量化耐受度好,4-bit 质量损失小
- mlx-optiq 生态在持续维护,社区关注度高
- 相比 GGUF 4-bit 同量化,生成推理 token 量约翻倍,较为冗长
- MLX 多轮对话性能明显低于单轮
- 推理能力基准测试仅 60%,相对薄弱
- 编程能力基准测试 70%,表现中等
mlx-community/Qwen3.5-9B-OptiQ-4bit · Hugging FaceBenchmarked 11 MLX models on M3 Ultra — here's which ...Qwen3.5-9B-OptiQ on M5 Pro (20c) — oMLX BenchmarkQwen 3.5 for MLX is like its own industrial revolution : r/Qwen_AIMLX vs GGUF (Unsloth) - Qwen3.5 122b-10b : r/LocalLLaMADFlash speculative decoding on Apple Silicon: 4.1x on Qwen3 ...Whats up with MLX? : r/LocalLLaMAam.will on X: "I'm not sure anyone is doing more in the MLX niche for local LLMs than Ivan is..." / X
截至 2026-07-15
本形态 ~9.8GB 8-bit · 国内 需代理 · 11,971 下载
仅 safetensors · 无 pickle 加载风险
快速上手
mlx_lm.generate --model mlx-community/Qwen3.5-9B-OptiQ-4bit 下载动量
观测时间线
模型家族
- Qwen3.5-9B
- 量化 MaralGPT-Mythos-9B (MaralGPT)
- 量化 Qwen3.5-9B (Qwen)
- 量化 Qwen3.5-9B-MTP-GGUF (unsloth)
- 量化 Qwen3.5-9B-OptiQ-4bit (mlx-community)
- 微调 Qwythos-9B (Empero)