模型 / Qwen3.5-2B-OptiQ-4bit (mlx-community)

Qwen3.5-2B-OptiQ-4bit (mlx-community)

4-bit混合精度MLX量化Qwen3.5-2B,苹果芯片推理

作者 mlx-community

仓库标识mlx-community/Qwen3.5-2B-OptiQ-4bit

显存未知许可 可商用任务 文本生成最近核对 2026-08-09
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
MLX-LM
下载
3,890

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mlx-lm generate --model mlx-community/Qwen3.5-2B-OptiQ-4bit

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
专为 Apple Silicon 优化的 Qwen3.5-2B 混合精度4-bit量化,性能优于均匀4-bit,通过 mlx-lm 一行代码即可运行,适合 Mac 用户本地部署。
对位
优于标准MLX 4-bit量化
适合
Apple Silicon本地推理及加速 / 代码生成与工具调用
不适合
长上下文检索 (HashHop 0%)

独立证据与社区反馈

4 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

OptiQ-4bit 量化在社区口碑不错:有人称它好于标准 4-bit,4B 版还被用户评价为「extremely good」;按 Qwen3.5-2B-OptiQ-4bit 卡片自述,它在同磁盘占用下各项基准均超过 stock uniform 4-bit。社区的实际用法里,2B 4bit 常被当作轻量辅助,由 27B LLM 调度去处理视觉描述等子任务。MLX 在 Apple Silicon 上仍是主流,不过也有 32GB 机器用户反映 MLX 量化会占满内存、频繁崩溃,转而投向 gguf;另有人觉得 mxfp4 更快。

  • 同磁盘占用下各项基准均优于 stock uniform 4-bit:混合精度分配让该量化在每个基准上都胜出。
  • 充当轻量视觉助手:社区建议用 2B 4bit 处理视觉描述等任务,由 27B LLM 按需调度、再拿结果继续推理,避免让大参数量主力去读图。
  • 比标准 4-bit 更好的量化选择:评论认为 OptiQ 与 mxfp4 都好于标准 4-bit。
  • 最优 4-bit 已够用:若做到数学上最优的 4-bit 量化,更多位数带来的提升有限,不必上 8-bit。
  • 上手简单:mlx_lm 的 load/generate 几行代码即可加载并生成。
  • MLX 稳定性不佳:有 m1 max 32GB 用户反映 MLX 量化会占满内存、频繁崩溃,最终改用 gguf。
  • mxfp4 被部分人认为更快更好:评论称其优于 q4 且速度更快,因为 Apple Silicon 的 MLX 内核针对均匀 fp4 数学优化。
  • 2B 只适合当辅助:社区把它定位成「lighter and faster」的补充,复杂推理仍依赖主力。
  • 4bit 与 8bit 取舍仍有讨论:虽有人认为最优 4-bit 已足够,但该话题仍是社区常议。

可信度3.9k下载,9赞,能力分47.66(超统一4-bit +2.12),HumanEval+11.6%

完整规格

规模
2B · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
apache-2.0 · 可商用
框架
mlx-lm / mlx-optiq
血统
量化自 Qwen3.5-2B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1.1k → 1.1k

观测时间线