Qwen3.5-0.8B-OptiQ-4bit (mlx-community)
苹果芯片4-bit MLX 量化 Qwen3.5-0.8B
- Apple Silicon
- 已量化
仅 safetensors · 无 pickle 加载风险
社区实测
Qwen3.5-0.8B-OptiQ-4bit 是 mlx-optiq 为 Apple Silicon 产出的灵敏度感知混合精度 4-bit 量化版本,在六项能力评分上全面超越统一 4-bit 量化,体积仅约 0.5 GB;社区反馈 Qwen 3.5 在 MLX 上推理速度极快,适合轻量本地任务。
- 灵敏度感知混合精度量化:敏感层保留 8-bit,鲁棒层压缩至 4-bit,同等磁盘占用下全面超越统一 4-bit 量化
- 体积仅约 0.5 GB,适合 Apple Silicon 设备本地部署,资源占用极低
- 内置 MTP head,通过 optiq serve --mtp 可获得 1.4× 解码加速
- 在六项能力评分的每一项基准上均优于统一 4-bit 量化
- 可在 MacBook 和 iPhone 上完全离线运行,支持本地编程和视觉任务
- Qwen 3.5 在 MLX 上推理速度极快,社区反馈 Mac Studio M3 上 4-bit 模型速度令人惊叹
- 能力评分仅 27.0%,官方定位为玩具代理和提示词重写器,不适合复杂推理或生产级应用
- omlx v0.2.20 升级后曾出现 Internal server error,社区工具链稳定性有待观察
- 0.8B 参数规模天然受限,仅适合极轻量场景
来源
mlx-community/Qwen3.5-0.8B-OptiQ-4bit · Hugging FaceQwen 3.5 for MLX is like its own industrial revolution : r/Qwen_AI"Internal server error" after upgrading to `v0.2.20` · Issue #361 · jundot/omlx · GitHubQwen3.5 family · getting started · mlx-optiqQwen 3.5 Small Models Are INCREDIBLE! (Testing 0.8B & 2B On Edge Devices)
截至 2026-06-21
快速上手
pip install mlx-lm; mlx_lm.generate --model mlx-community/Qwen3.5-0.8B-OptiQ-4bit --prompt '...'