模型 / Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)

Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)

2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理

作者 EschaLabs

仓库标识EschaLabs/Qwen3.6-35B-A3B-Escha-W2

~12GB 2-bit许可 可商用任务 文本生成最近核对 2026-08-05
格式
2-bit
文件
~10GB
运行内存
~12GB–15GB
运行时
escha-runtime (SGLang)
下载
201

Hugging Face 源仓库 ↗

适合与不适合

入选理由
Qwen3.6-35B-A3B的2-bit量化版,12.3GB单卡可运行,通过OpenAI兼容接口本地部署,保持原始模型97%+能力,适合代码生成和推理任务。
对位
对位 3B 激活参数开源模型如 Llama-3.2-3B
适合
本地私密推理 / 编程与复杂推理
不适合
多模态或视觉输入

独立证据与社区反馈

9 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

Escha-W2 量化在单张消费级 GPU 上保留 ~100% FP8 性能、跑到 225 tok/s,部署门槛低;但模型在写不熟悉的代码时容易出 eager error、重复输出,需要人工引导,社区口碑两极分化。

  • 12.3GB 磁盘占用,可跑在单张消费级 GPU 上(RTX 4090)
  • 单流生成 ~225 tok/s,推理速度可观
  • 2-bit 量化仍保留 ~100% FP8 基准性能
  • 提供 OpenAI 兼容 HTTP API,本地部署接入方便
  • 上手快——有人在 RTX 5090 上几分钟就跑起来了
  • 可与 VS Code + 本地 OpenAI API 端点配合使用
  • 有人引导时能做 agentic coding,效果不错
  • 在同尺寸开源模型中处于智力第一梯队
  • 在某些配置下会无限重复输出,难以正常完成代码编辑
  • 遇到不熟悉的代码容易出 eager error,几次调用就能破坏企业级代码库
  • 不擅长探索代码库和制定计划,需搭配能消化全量上下文的模型
  • 比 Claude 更挑剔/不稳定,需要较多人工引导
  • 输出非常冗长(very verbose)
  • 在同尺寸开源模型中价格偏高
  • 存在使用错误版本(未固定 layers)导致体验差的情况
  • benchmark 在知识和技能维度上明显弱于部分竞品

可信度基准保留 FP8 100.2%,HumanEval+ 92.07,MATH-500 93.8

完整规格

规模
35B (3B active) · 128k · 下载 ~10GB · 显存最低 ~12GB · 推荐 ~15GB · 2-bit(估算)
授权
Apache-2.0 · 可商用
框架
escha-runtime (SGLang) / zml
血统
量化自 Qwen3.6-35B-A3B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 8.7k → 6.2k · likes +34

观测时间线

模型家族

查看全部家族 →