Qwen3.5-35B-A3B (Qwen)
4-bit MLX 量化,Apple Silicon 本地运行文本生成
社区实测
社区普遍认为 Qwen3.5-35B-A3B 是一款令人印象深刻的 MoE 模型,在 agentic 编程场景下表现突出,推理速度极快(超过 100 t/s)。但仅 3B 激活参数使其在需要独立决策的复杂任务上捉襟见肘,决策质量明显下降,整体定位为执行能力强、速度快但不宜独立承担复杂决策的本地模型。
- 本地推理速度极快,可达 100 t/s 以上
- agentic 编程场景表现出色,被视为该领域的变革性模型
- 可在 36GB 系统的消费级笔记本上运行
- 小到中型编程任务在明确指令下可做到与 Sonnet 相当的水平
- 纯推理吞吐量可达 190 t/s(API 端点 GMI FP8),TTFT 低至 0.60s(DeepInfra FP8)
- 仅 3B 激活参数即超越前代 Qwen3-235B-A22B,证明架构与数据质量优于堆参数量
- 原生多模态视觉语言模型,视觉推理达到或超过 Qwen-3-VL
- 支持 1M token 上下文窗口(通过 Gated DeltaNet 混合注意力)
- Apache 2.0 开源许可,可商用
- API 价格低至 $0.69/1M tokens,输入低至 $0.25/1M tokens
- 在需要独立决策时表现糟糕,3B 激活参数的限制明显暴露
- 硬核编程任务上表现崩溃,在 70 个真实仓库测试中不合格
- 整体能力明确低于 Claude Sonnet,复杂任务差距明显
- 执行过程中倾向于中途偏离用户给出的详细指令
- 对量化精度和推理参数非常敏感,需要高量化精度和正确的参数设置
- 在某些对比测试中处理任务质量不如对比模型
- 速度虽快,但任务完成质量下降(以质量换速度)
Something is afoot in the land of Qwen | Hacker NewsQwen3.5-35B-A3B is a gamechanger for agentic coding.Qwen3.5 35b is sure one the best local model (pulling ...Qwen 3.5 craters on hard coding tasks — tested all Qwen3. ...Compared QWEN 3.6 35B with QWEN 3.6 27B for coding ...Is qwen3.6 35b a3b good for coding at all? : r/LocalLLaMAQwen3.5 35B A3B API Benchmarks: Latency, Throughput & CostQwen 3.5 Explained: Architecture, Upgrades Over Qwen 3, ...Qwen3.5-35B-A3B Benchmarks, Pricing & SizeQwen 3.5 Medium Models: Benchmarks, Pricing, and Guide
截至 2026-07-15
本形态显存 Q4 ~23GB / FP16 ~84GB · 国内 需代理 · 720 下载
仅 safetensors · 无 pickle 加载风险
快速上手
mlx_lm.generate --model mlx-community/Qwen3.5-35B-A3B-OptiQ-4bit --prompt 'Explain quantum computing.' --max-tokens 200