模型 / Qwen3.5-9B-OptiQ-4bit (mlx-community)

Qwen3.5-9B-OptiQ-4bit (mlx-community)

Apple Silicon 本地 4-bit 混合精度量化文本生成模型

作者
mlx-community
对位
对位 Llama-3-8B / Gemma-2-9B
适合
本地代码/推理/工具调用任务 / Apple Silicon 上的高精度轻量部署
不适合
需 NVIDIA GPU 的部署场景
入选理由
Apple Silicon上的Qwen3.5-9B 4bit混合精度量化,比统一4bit稍好,用mlx-lm可直接加载运行,适合Mac用户本地高效部署。
规模
9B · 128k · 最低 ~9.8GB · 8-bit(估算)
授权
apache-2.0 · 需自查
框架
mlx
血统
量化自 Qwen3.5-9B
国内访问
需代理
可信度
下载量近1.2万,六基准能力分66.77,超过均匀4-bit

社区实测

Qwen3.5-9B MLX 4bit 在 Apple Silicon 上速度与质量平衡出色,OptiQ 混合精度量化在同等磁盘占用下全面优于统一 4-bit 量化。社区实测 106 t/s 生成速度、71% 综合评分,工具调用 83% 表现出色,但推理和编程能力相对偏弱,MLX 多轮对话性能也低于 GGUF。

  • OptiQ 混合精度量化在同等磁盘占用下,六项基准测试全面优于统一 4-bit 量化
  • 生成速度快,M3 Ultra 上达 106 t/s
  • 内存占用低,仅约 5 GB 运行时 / 7.7-8.4 GB 峰值
  • 提示处理速度极快,M5 Pro 上 4k 上下文达 1,539 tok/s
  • 相比 Llama 3 405B 同任务从约 500s 降到约 30s
  • 工具调用能力突出,基准测试得分 83%
  • Qwen 系列模型对量化耐受度好,4-bit 质量损失小
  • mlx-optiq 生态在持续维护,社区关注度高
  • 相比 GGUF 4-bit 同量化,生成推理 token 量约翻倍,较为冗长
  • MLX 多轮对话性能明显低于单轮
  • 推理能力基准测试仅 60%,相对薄弱
  • 编程能力基准测试 70%,表现中等

截至 2026-07-15

本形态 ~9.8GB 8-bit · 国内 需代理 · 11,971 下载

仅 safetensors · 无 pickle 加载风险

快速上手

mlx_lm.generate --model mlx-community/Qwen3.5-9B-OptiQ-4bit

本形态源 ↗

下载动量

30天下载 11.8k → 9.7k

观测时间线

模型家族

查看全部家族 →