模型 / Qwen3.5-9B (Qwen)

Qwen3.5-9B (Qwen)

Qwen3.5-9B MoQ量化版,MTP推测解码,适合本地快速生成

作者
w-ahmad
对位
替代 Unsloth Dynamic 等均匀量化,同体积质量更高
适合
本地内存受限下的9B模型推理 / 利用MTP推测解码加速文本生成
不适合
追求极致精度或官方全量模型的任务
入选理由
基于Qwen3.5-9B的MoQ量化模型,有现成GGUF文件可直接用llama.cpp推理,第三方评测显示性能优于同类量化。
规模
9B · 32k · 最低 ~5.4GB · 4-bit(估算)
授权
MIT · 可商用
框架
llama.cpp / llama-cpp-python
血统
量化自 Qwen3.5-9B
国内访问
需代理
可信度
6k下载,基于Qwen3.5-9B,MoQ量化在WikiText上优于UnslothDynamic约10%

社区实测

社区口碑两极分化明显:在 agentic coding 和本地小任务上表现出超预期的性价比与速度,benchmark 成绩亮眼;但在工具调用格式遵循、多语言逻辑一致性、事实准确性方面翻车案例不少,实际体验与 benchmark 排名存在落差。

  • 搭配 Kilo Code、Roo Code、Continue 做 agentic coding 体验良好
  • 代码补全质量优于更小的 Qwen2.5 Coder 模型
  • 在部分用户实测中产出可直接交付的代码,整体优于 Qwen 2.5 Coder 32B
  • 可在 8GB 内存、2019 年笔记本等 modest 硬件上本地运行
  • 适合本地工具调用与信息抽取等嵌入式应用
  • 适合邮件分类等小型实用任务
  • 在 GPQA Diamond、MMLU-Pro、MMMLU 等 benchmark 上超越数倍参数量的更大模型
  • 在 5/8 项共享 benchmark 上击败 Gemma-4-12B,参数量更小
  • 对自定义工具调用格式(如 <call>...</call>)遵循能力差
  • 部分 prompt 字符串会破坏输出逻辑
  • 在多语言交流中逻辑有问题,英语场景也偶有出现
  • 事实性任务中存在明显幻觉
  • benchmark 高分与实际使用可靠性之间存在落差
  • 不能替代 Opus 等大模型用于专业日常工作
  • 纯编码能力上 Gemma-4-12B 可能略优

截至 2026-06-21

本形态 ~5.4GB 4-bit · 国内 需代理 · 6,044 下载

快速上手

ollama run hf.co/w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP

本形态源 ↗

下载动量

30天下载 2.8k → 2.1k

观测时间线

模型家族

查看全部家族 →