模型 / Qwen3.5-0.8B-OptiQ-4bit (mlx-community)

Qwen3.5-0.8B-OptiQ-4bit (mlx-community)

苹果芯片4-bit MLX 量化 Qwen3.5-0.8B

作者 mlx-community

仓库标识mlx-community/Qwen3.5-0.8B-OptiQ-4bit

显存未知许可 可商用任务 文本生成最近核对 2026-08-09
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
mlx-lm
下载
4,860

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
为Apple Silicon优化的混合精度量化版Qwen3.5-0.8B,mlx-lm一行代码即可运行,推理性能提升但需macOS环境。
对位
对位均匀 4-bit MLX 量化
适合
Apple Silicon 本地推理 / 工具调用与代码生成
不适合
非 Apple Silicon 平台

独立证据与社区反馈

6 个独立来源 · 另 7 官方/转载最近验证 2026-08-09

社区对 OptiQ 混精度 4bit 系列总体偏正面:官方称各尺寸在同磁盘大小下优于 uniform 4bit、并在六指标 Capability Score 上全面胜出,亦有实测给出「极好」的评价。对苹果用户,MLX 被视为本地部署的主流路线,上手快、速度快。不过 MLX 生态的稳定性与内存占用仍被反复吐槽,部分用户因此转投 GGUF。

  • 同磁盘大小下优于 uniform 4bit:按层混合分配位宽,在相同体积下拿到更高表现(该量化自身官方说明)。
  • 系列内各尺寸(2B/4B/9B/27B/35B-A3B)均称在六指标 Capability Score 上全面超越 uniform 4bit。
  • 对苹果用户,MLX 被视为本地部署的主流路线。
  • 4bit 量化运行速度快,结果质量受认可。
  • 提供开箱即用的 mlx_lm 加载与生成示例,本地调用门槛低。
  • 混精度方案让部分层保持 8bit、部分 4bit,在体积与质量之间做折中。
  • 量化研究层面显示最优 4bit 量化往往已够用,多数场景不必上 8bit。
  • MLX 4bit 出现不稳定报告(无限循环、逻辑异常),有用户改用更小的 8bit 反而更可靠。
  • MLX 内存占用高、频繁崩溃,部分用户因此转向 GGUF。
  • 位宽分配基于 KL 散度敏感度校准,最终质量依赖校准集的构成。
  • 复杂/长计算任务上尺寸差距明显,小尺寸更容易暴露短板(家族对比中 27B 与 122B 差距大)。
  • 实际体验与硬件平台相关:有用户反映 M1 Max 上 MLX 不稳定、占满内存,也有人几分钟内就在 RTX 5090 上跑起同系列。
  • 4bit 是否够用在社区仍有分歧:有人觉得最优 4bit 就够,有人宁选更小尺寸的 8bit 保证稳定性。

可信度下载 4.8k,mlx-community 出品,能力评分 +4.27 超均匀 4-bit

完整规格

规模
0.8B · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
Apache 2.0 · 可商用
框架
mlx-lm / mlx-optiq
血统
量化自 Qwen3.5-0.8B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1.4k → 1.4k · likes +1

观测时间线