此页是 2026-07-06 的观测快照,查看该模型当前信息 → /m/manjunathshiva__qwen36-35b-a3b-tq3a-tqte-g64/

归档 / 2026-07-06 / Qwen3.6-35B-A3B (Qwen)

Qwen3.6-35B-A3B (Qwen)

三元专家量化版,9.4 GB 全量跑在 16 GB Mac 上

  • Apple Silicon
入选理由
将35B MoE压缩至9.4GB,可全量驻留16GB Mac并实测10.4 tok/s;创新1.58bit专家量化配合3bit注意力,适合本地聊天、代码生成与文档摘要。
对位
Qwen2.5-3B / Llama-3.2-3B 等 3B 激活模型
适合
本地聊天与问答 / 一次性代码生成与摘要
不适合
Agent 工具链循环与多步代码修复
规模
35B (3B 激活) · 未知 · Q4 ~19GB / FP16 ~69GB
授权
Apache-2.0 · 需自查
框架
mlx
血统
量化自 Qwen3.6-35B-A3B
可信度
MMLU-Redux 80.1% (thinking),6 项探针测试全部通过

仅 safetensors · 无 pickle 加载风险

社区实测

社区普遍认为 Qwen3.6-35B-A3B 是当前性价比极高的本地编码模型,3B 激活参数跑出接近云端模型的编码效果,在消费级硬件上速度快且 Apache 2.0 开源,但对量化精度和推理参数极其敏感,部分密集小模型在特定任务上反而更强,实际表现因场景波动较大。

  • 在消费级笔记本/MacBook/迷你PC上运行本地大模型编码——MoE 架构专为此类通用硬件设计
  • 配合合适的 agent 脚手架后,本地编码能力可达到与云端模型竞争的水平(Polyglot 78.7%,进入公开前十)
  • 在 RTX 4090 上达到 120+ tokens/s 的高速推理,本地体验流畅
  • SVG 生成质量在笔记本本地运行即可超过 Claude Opus 4.7 云端版本
  • Apache 2.0 开源许可,社区可自由使用、量化和部署
  • SWE-bench Verified 得分 73.4%,在编码基准上大幅领先同量级开源模型
  • 编码基准上以 21 分优势击败 Google Gemma 4 26B A4B
  • 被多位开发者列为日常本地编码首选模型
  • 对量化精度和推理参数极其敏感,参数不对时表现明显下降
  • MoE 的专家激活机制并不像社区预期那样能「解锁」更多模型能力
  • Power Ranking 编码任务仅比上代 Qwen 3.5 同尺寸略好(11/98 vs 10/98),提升有限
  • 在编码任务上被 Qwen 3.5 27B 密集模型大幅超越(26/98 vs 11/98),不属同一级别
  • 知识和技能类基准表现明显弱于其他维度,存在「刷榜」嫌疑
  • SVG 生成在物理合理性/遵循约束方面不如 Claude Opus 4.7
  • 表现不稳定,属于「碰对了参数就很好用」的类型

截至 2026-07-08

快速上手

pip install 'turboquant-mlx-full>=0.12.3' && python -m turboquant_mlx.generate --model manjunathshiva/Qwen3.6-35B-A3B-tq3a-tqTe-g64

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   5 / 5
总分
11

HuggingFace 原始数据 (抓取于 2026-07-06)

作者
manjunathshiva
任务类型
text-generation
推理库
mlx
下载
414
点赞
0
许可证
Apache-2.0
标签
mlx, safetensors, qwen3_5_moe, turboquant, moe, ternary, sub-2-bit, hybrid-quant, text-generation, conversational, base_model:Qwen/Qwen3.6-35B-A3B, base_model:quantized:Qwen/Qwen3.6-35B-A3B, license:apache-2.0, 3-bit, region:us

探索

源链接