Qwen3.5-0.8B-OptiQ-4bit (mlx-community)
苹果芯片4-bit MLX 量化 Qwen3.5-0.8B
仓库标识mlx-community/Qwen3.5-0.8B-OptiQ-4bit
显存未知许可 可商用任务 文本生成最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(4bit)。
适合与不适合
独立证据与社区反馈
社区对 OptiQ 混精度 4bit 系列总体偏正面:官方称各尺寸在同磁盘大小下优于 uniform 4bit、并在六指标 Capability Score 上全面胜出,亦有实测给出「极好」的评价。对苹果用户,MLX 被视为本地部署的主流路线,上手快、速度快。不过 MLX 生态的稳定性与内存占用仍被反复吐槽,部分用户因此转投 GGUF。
- 同磁盘大小下优于 uniform 4bit:按层混合分配位宽,在相同体积下拿到更高表现(该量化自身官方说明)。
- 系列内各尺寸(2B/4B/9B/27B/35B-A3B)均称在六指标 Capability Score 上全面超越 uniform 4bit。
- 对苹果用户,MLX 被视为本地部署的主流路线。
- 4bit 量化运行速度快,结果质量受认可。
- 提供开箱即用的 mlx_lm 加载与生成示例,本地调用门槛低。
- 混精度方案让部分层保持 8bit、部分 4bit,在体积与质量之间做折中。
- 量化研究层面显示最优 4bit 量化往往已够用,多数场景不必上 8bit。
- MLX 4bit 出现不稳定报告(无限循环、逻辑异常),有用户改用更小的 8bit 反而更可靠。
- MLX 内存占用高、频繁崩溃,部分用户因此转向 GGUF。
- 位宽分配基于 KL 散度敏感度校准,最终质量依赖校准集的构成。
- 复杂/长计算任务上尺寸差距明显,小尺寸更容易暴露短板(家族对比中 27B 与 122B 差距大)。
- 实际体验与硬件平台相关:有用户反映 M1 Max 上 MLX 不稳定、占满内存,也有人几分钟内就在 RTX 5090 上跑起同系列。
- 4bit 是否够用在社区仍有分歧:有人觉得最优 4bit 就够,有人宁选更小尺寸的 8bit 保证稳定性。
- 社区实测r/LocalLLaMA on Reddit: Is mlx-optiq legit? Has anyone tested the new quants for Gemma4/qwen3.6 yet?
- 社区实测r/LocalLLM on Reddit: 4bit vs 8bit
- 社区实测r/LocalLLaMA on Reddit: Whats up with MLX?
- 社区实测r/Qwen_AI on Reddit: Qwen 3.5 for MLX is like its own industrial revolution
- 社区实测Qwen3.8-Max: A New Bar for Coding and Cowork | Hacker News
- 社区实测r/LocalLLaMA on Reddit: Qwen3.5 family comparison on shared benchmarks
- 官方/厂商mlx-community/Qwen3.5-0.8B-OptiQ-4bit · Hugging Face
- 官方/厂商mlx-community/Qwen3.5-2B-OptiQ-4bit · Hugging Face
- 官方/厂商mlx-community/Qwen3.6-27B-OptiQ-4bit · Hugging Face
- 官方/厂商mlx-community/Qwen3.5-4B-OptiQ-4bit · Hugging Face
- 官方/厂商mlx-community/Qwen3.5-9B-OptiQ-4bit · Hugging Face
- 官方/厂商mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit · Hugging Face
- 官方/厂商mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit · Hugging Face
可信度下载 4.8k,mlx-community 出品,能力评分 +4.27 超均匀 4-bit
完整规格
下载动量
30天下载 1.4k → 1.4k · likes +1