模型 / Qwen3.6-35B-A3B-VQ (aquaman164)

Qwen3.6-35B-A3B-VQ (aquaman164)

MLX VQ量化35B MoE,适合Apple Silicon本地推理

作者
aquaman164
对位
对位3B级密集模型
适合
本地日常对话与文本生成 / 资源受限的Apple设备推理
不适合
云端大规模部署或高精度任务
入选理由
Qwen3.6-35B-A3B的向量量化版,同尺寸下PPL优于标量量化;需在Apple Silicon上运行自定义Metal内核,提供OpenAI兼容API,适合Mac用户自部署.
规模
35B (3B激活) · 128k · 最低 ~21GB · 4-bit(估算)
授权
Apache-2.0 · 需自查
框架
mlx
血统
量化自 Qwen3.6-35B-A3B
国内访问
需代理
可信度
首个Apple Silicon上trained-codebook VQ模型,11.53GB,实测66 tok/s

社区实测

社区普遍认为 Qwen3.6-35B-A3B 是当前性价比最高的开源本地编程模型之一,以 3B 活跃参数达到 73.4% SWE-bench 得分,可在消费级笔记本上流畅运行;但在实际使用中需要耐心调参,对 prompt 较敏感,长上下文提示处理延迟明显。

  • 以 3B 活跃参数取得 73.4% SWE-bench Verified 得分,超过 Gemma 4 31B(52.0%)和 Gemma 4 26B A4B(52.0%)
  • 35B 总参数、3B 活跃参数的 MoE 架构,计算成本相当于 3B 模型,可在消费级笔记本上本地运行
  • SVG/图像生成质量在某些场景下优于 Claude Opus 4.7,如 pelican 骑自行车和 flamingo 骑独轮车的 SVG 生成
  • 有社区发布的 Uncensored Aggressive 变体,0/465 次拒绝,声称无能力损失、无循环、无退化
  • Apache 2.0 开源许可证,允许商用
  • 在 VS Code + Copilot 集成中可正常完成复杂前端项目(Bike Shop Service Tracker),首次运行即功能完整
  • 生成速度稳定在 94-105 t/s,适合消费级 GPU 本地推理
  • 支持 262K 上下文窗口及多模态输入(文本+图像+视频)
  • K_P 量化方案通过模型特定分析在相近体积下提升 1-2 个量化级别的质量
  • 长上下文提示处理延迟突出,38K token 的 prompt 处理耗时 17.3 秒
  • 对 prompt 格式异常敏感,会在与上下文冲突时强行将示例塞入回答
  • 嵌套 JSON 输出不可靠,改用 XML 格式后表现正常
  • 部分用户在 OpenCode 中遇到重复循环和空字符串函数调用问题,后自行归因于参数配置
  • Q6_K 量化版本在编码规划和组织逻辑上被社区报告优于 Q8_0,大不一定更好
  • BenchLM 综合评分仅 51.47/100,排名 #104/200
  • 物理合理性图像生成弱于 Claude Opus 4.7(flamingo 骑独轮车测试中 Opus 更接近物理真实)
  • 需要耐心调参,非开箱即用的完美体验

截至 2026-07-19

本形态 ~21GB 4-bit · 国内 需代理 · 524 下载

仅 safetensors · 无 pickle 加载风险

快速上手

huggingface-cli download aquaman164/Qwen3.6-35B-A3B-MLX-VQ-2.6bpw --local-dir qwen-vq && python qwen-vq/code/vq_serve.py --model qwen-vq

本形态源 ↗

下载动量

30天下载 524 → 1.2k

观测时间线

模型家族

查看全部家族 →