模型 / Qwen3.5-35B-A3B (Qwen)

Qwen3.5-35B-A3B (Qwen)

4-bit MLX 量化,Apple Silicon 本地运行文本生成

作者
mlx-community
对位
对位 Qwen2.5-3B
适合
Apple Silicon 本地大模型推理 / 敏感层 8-bit 保精度的代码/指令任务
不适合
显存<16GB 设备运行受限
入选理由
为Apple Silicon优化的混合精度量化版Qwen3.5-35B-A3B,5分钟即可本地运行,基准略优于均匀4bit。适合Mac用户快速部署。
规模
35B (3B 激活) · 128k · Q4 ~23GB / FP16 ~84GB
授权
apache-2.0 · 需自查
框架
mlx
国内访问
需代理
可信度
公开6项基准对比,Capability Score 77.42,超统一4-bit 0.5分

社区实测

社区普遍认为 Qwen3.5-35B-A3B 是一款令人印象深刻的 MoE 模型,在 agentic 编程场景下表现突出,推理速度极快(超过 100 t/s)。但仅 3B 激活参数使其在需要独立决策的复杂任务上捉襟见肘,决策质量明显下降,整体定位为执行能力强、速度快但不宜独立承担复杂决策的本地模型。

  • 本地推理速度极快,可达 100 t/s 以上
  • agentic 编程场景表现出色,被视为该领域的变革性模型
  • 可在 36GB 系统的消费级笔记本上运行
  • 小到中型编程任务在明确指令下可做到与 Sonnet 相当的水平
  • 纯推理吞吐量可达 190 t/s(API 端点 GMI FP8),TTFT 低至 0.60s(DeepInfra FP8)
  • 仅 3B 激活参数即超越前代 Qwen3-235B-A22B,证明架构与数据质量优于堆参数量
  • 原生多模态视觉语言模型,视觉推理达到或超过 Qwen-3-VL
  • 支持 1M token 上下文窗口(通过 Gated DeltaNet 混合注意力)
  • Apache 2.0 开源许可,可商用
  • API 价格低至 $0.69/1M tokens,输入低至 $0.25/1M tokens
  • 在需要独立决策时表现糟糕,3B 激活参数的限制明显暴露
  • 硬核编程任务上表现崩溃,在 70 个真实仓库测试中不合格
  • 整体能力明确低于 Claude Sonnet,复杂任务差距明显
  • 执行过程中倾向于中途偏离用户给出的详细指令
  • 对量化精度和推理参数非常敏感,需要高量化精度和正确的参数设置
  • 在某些对比测试中处理任务质量不如对比模型
  • 速度虽快,但任务完成质量下降(以质量换速度)

截至 2026-07-15

本形态显存 Q4 ~23GB / FP16 ~84GB · 国内 需代理 · 720 下载

仅 safetensors · 无 pickle 加载风险

快速上手

mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200

本形态源 ↗

下载动量

观测时间线