模型 / Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)

Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)

Apple Silicon 4-bit MLX混精量化+MTP投机解码

作者 mlx-community

仓库标识mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit

显存未知许可 可商用任务 文本生成最近核对 2026-08-09
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
OPTIQ
下载
9,077

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

optiq serve --model mlx-community/Qwen3.6-35B-A3B-OptiQ-4bit --mtp

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
针对Apple Silicon的混合精度量化版Qwen3.6 MoE,4bit/8bit混合,长上下文检索提升8%,适合苹果设备快速部署大模型。
对位
对位uniform-4bit MLX量化
适合
Apple Silicon本地推理 / 代码/Agent/约束指令
不适合
非Apple Silicon平台

独立证据与社区反馈

10 个独立来源 · 另 3 官方/转载最近验证 2026-08-09

社区口碑分化明显:35B-A3B 以 MoE 架构领跑本地编码基准、在 Apple Silicon 上推理速度突出,OptiQ-4bit 在六指标能力分上全面优于标准均匀 4-bit;但多人反馈它相对 27B 是「更快但质量降级」,在不熟悉的代码上易出低级错误,少数人还遇到死循环/逻辑异常。

  • Apple Silicon 上推理速度突出:同一台 M1 Ultra 上 35B 生成约 52 tok/s,27B 只有约 17-18 tok/s,有人实测 35B-A3B 比 27B 快约 3 倍
  • 内存门槛低:4-bit 量化体积不到 18GB,32GB 设备即可运行,24GB Mac 也能跑起来
  • 低显存也能用:有人在仅 4GB VRAM 的 RTX 2050 上把 35B-A3B 跑了起来,并称「surprisingly fast」
  • 本地编码表现领先:SWE-bench Verified 得分 73.4%,社区一度认为它是当前最好的本地编码选择
  • OptiQ-4bit 量化质量有据可依:在六指标能力分上全面击败标准均匀 4-bit,同类做法在上一代 35B-A3B 上也同样成立
  • 长上下文可用:5090 上 Q6_K + Q4_0 KV 在 123K context 下仍稳定 50 tok/s,双 5060 Ti 在 90K context 下约 21.7 tok/s
  • 生态易用:Ollama 上直接用 mlx 优化版,有用户反馈「works really well」
  • 不熟悉的代码上容易出低级错误,有用户称 A3B 能在 3-4 次调用内搞坏企业代码库
  • 相对 27B 是质量降级:更快、世界知识更多,但质量「a step down」,多人明确表示更偏好 27B
  • 4-bit MLX 版有死循环/逻辑异常问题,有用户因此换回更小的 qwen3.5-9b(8bit)反而更顺手
  • 基准上知识/技能类指标明显偏弱,虽然社区实际感受与基准常有出入
  • 有用户抱怨 35B 干活耗时太久(「why it does code for so long」),体感偏慢
  • 消费级 NVIDIA 显存上需要激进量化才能跑,或需多卡并加 --cpu-moe 之类配置

可信度6项基准均分76.78, 超uniform-4bit 1.12, MTP加速1.4×

完整规格

规模
35B-A3B · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
Apache-2.0 · 可商用
框架
mlx / mlx-optiq
血统
量化自 Qwen3.6-35B-A3B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 8.5k → 6.1k · likes +7

观测时间线

模型家族

查看全部家族 →