Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)
2-bit Qwen3.6-35B-A3B,12.3GB,单卡本地推理
仓库标识EschaLabs/Qwen3.6-35B-A3B-Escha-W2
~12GB 2-bit许可 可商用任务 文本生成最近核对 2026-08-05
- 格式
- 2-bit
- 文件
- ~10GB
- 运行内存
- ~12GB–15GB
- 运行时
- escha-runtime (SGLang)
- 下载
- 201
适合与不适合
独立证据与社区反馈
Escha-W2 量化在单张消费级 GPU 上保留 ~100% FP8 性能、跑到 225 tok/s,部署门槛低;但模型在写不熟悉的代码时容易出 eager error、重复输出,需要人工引导,社区口碑两极分化。
- 12.3GB 磁盘占用,可跑在单张消费级 GPU 上(RTX 4090)
- 单流生成 ~225 tok/s,推理速度可观
- 2-bit 量化仍保留 ~100% FP8 基准性能
- 提供 OpenAI 兼容 HTTP API,本地部署接入方便
- 上手快——有人在 RTX 5090 上几分钟就跑起来了
- 可与 VS Code + 本地 OpenAI API 端点配合使用
- 有人引导时能做 agentic coding,效果不错
- 在同尺寸开源模型中处于智力第一梯队
- 在某些配置下会无限重复输出,难以正常完成代码编辑
- 遇到不熟悉的代码容易出 eager error,几次调用就能破坏企业级代码库
- 不擅长探索代码库和制定计划,需搭配能消化全量上下文的模型
- 比 Claude 更挑剔/不稳定,需要较多人工引导
- 输出非常冗长(very verbose)
- 在同尺寸开源模型中价格偏高
- 存在使用错误版本(未固定 layers)导致体验差的情况
- benchmark 在知识和技能维度上明显弱于部分竞品
- 社区实测Escha Labs on X: Escha-W2 quantization announcement
- 独立评测Escha-W2 on Interfaze
- 社区实测Qwen3.6-35b-a3b seems like the best coding model rn
- 社区实测Youtuber tries Qwen 3.5 35B, Qwen 3.6 35B, and Gemma 4 27b
- 社区实测Is qwen3.6 35b a3b good for coding at all?
- 社区实测Qwen3.6 35B A3B disappointment
- 独立评测Qwen3.6 35B A3B - Intelligence, Performance & Price Analysis
- 社区实测Hacker News: Qwen3.8-Max discussion
- 社区实测It's pretty close already. Check qwen3.6 27b
- 转载/仓库Qwen/Qwen3.6-35B-A3B · Is it really better in real world task?
可信度基准保留 FP8 100.2%,HumanEval+ 92.07,MATH-500 93.8
完整规格
下载动量
30天下载 8.7k → 6.2k · likes +34
观测时间线
模型家族
- Qwen3.6-35B-A3B
- 微调 Macaron-V1-Tall (MindLab)
- 量化 Qwen3.6-35B-A3B (AutomatosX)
- 量化 Qwen3.6-35B-A3B (Qwen)
- 量化 Qwen3.6-35B-A3B (andreaborio)
- 量化 Qwen3.6-35B-A3B-Escha-W2 (EschaLabs)
- 量化 Qwen3.6-35B-A3B-GGUF (Unsloth)
- 量化 Qwen3.6-35B-A3B-NVFP4 (NVIDIA)
- 量化 Qwen3.6-35B-A3B-OptiQ-4bit (mlx-community)
- 量化 Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
- 量化 Qwen3.6-35B-A3B-VQ (aquaman164)
- 微调 XYZ-Aquila-mini (XYZAILab)