SummFlow 2026-07-01 Hugging Face

Qwopus-3.6-35B-A3B-Coder (Jackrong)

关闭思考的编码代理模型,降低 token 延迟,适合本地工作流

入选理由
GGUF格式直接可跑,专为agentic coding优化,SWE-bench 62.4%(thinking-off),适合本地部署的代码代理工作流。
对位
对位 Ornith-1.0 35B
适合
代理循环中的代码编辑与调试 / 本地低 token 消耗编码任务
不适合
需要深度推理的长链问题
规模
35B (3B 激活) · 未知
授权
Apache-2.0 · 需自查
框架
llama.cpp / ollama / llama-cpp-python
血统
LoRA · 基于 Qwopus3.6-35B-A3B-v1
可信度
SWE-bench 300 任务 62.4%,Q5_K_M 量化,关闭思考

社区实测

Qwopus-3.6-35B-A3B-Coder 是一个面向编码代理的思考关闭、令牌高效模型,质量优于 3.5 版本且支持 CPU 卸载,但部分用户反馈社区微调实际可用性不稳定。

  • 在禁用显式长思考时实现令牌高效的编码代理执行
  • 相比 3.5 版本质量明显提升,支持部分 CPU 卸载运行
  • 相比 Qwen 3.6-35B-A3B 基础模型内存占用更少
  • 部分用户反映社区微调版本在实际使用中无法正常工作
  • 3.6 基础模型本身已减少过度思考,使得思考关闭微调的必要性降低

截至 2026-07-08

快速上手

llama-server -hf Jackrong/Qwopus3.6-35B-A3B-Coder-MTP-GGUF -m qwopus-35b-a3b-coder-q5_k_m.gguf