模型 / Qwen3.5-9B (Qwen)

Qwen3.5-9B (Qwen)

Qwen3.5-9B MoQ量化版,MTP推测解码,适合本地快速生成

作者 w-ahmad

仓库标识w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP

显存未知许可 可商用任务 文本生成最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
OLLAMA
下载
6,044

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/w-ahmad/Qwen3.5-9B-GGUF-MoQ-MTP

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
基于Qwen3.5-9B的MoQ量化模型,有现成GGUF文件可直接用llama.cpp推理,第三方评测显示性能优于同类量化。
对位
替代 Unsloth Dynamic 等均匀量化,同体积质量更高
适合
本地内存受限下的9B模型推理 / 利用MTP推测解码加速文本生成
不适合
追求极致精度或官方全量模型的任务

独立证据与社区反馈

14 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

社区共识:Qwen3.5-9B 把「小体积强性能」做到了本地玩家意外的高度——基准榜上它以约 1/13 的参数规模反超 120B 级对手(GPQA Diamond 81.7 对 80.1,文档基准与 Gemini 3.1 Pro 打平),几 GB 的量化就能在普通笔记本上跑 agentic 编程与工具调用,被反复评价为「比更大的还快还稳」、性价比突出;但社区同样反复提醒:它并非全能手,平均吞吐低于同类同尺寸开源款,实际速度高度依赖运行方式(默认 ollama 偏慢,Llama.cpp 自编译加精调量化可快数倍),且解题能力已被更新的 3.6 系列反超。

  • 把 9B 级小体积跑在普通笔记本/随身电脑上——约 6GB 的 Q6 量化即可,满足离家在外仍要本地推理的需求
  • 以极小参数反超 120B 级对手,GPQA Diamond 81.7 对 80.1,官方与第三方反复印证约 13 倍于自身的参数规模被它打平或反超,性价比突出
  • agentic 编程与轻度工具调用——社区用它跑 agent 任务和轻量 tool calling 可行,而对比对象 Gemma4-12B 出现幻觉式工具调用、完不成同样任务
  • RAG + 代码生成场景——实测约 30 tok/s,且在长上下文里保持 grounded、不跑题
  • 文档类任务——文档基准 86.5,与 Gemini 3.1 Pro 的 86.8 打平,长文档/结构化任务上不输旗舰
  • 混合架构(门控 Delta 网络 + 稀疏 MoE)主打高吞吐、低延迟与低成本推理
  • 平均吞吐低于同类同尺寸开源款——72.9 t/s 对中位 98.4 t/s,别默认「小就快」
  • 默认 ollama 跑容易觉得性能差/慢——换 Llama.cpp 自编译或 Llama app 可提速 30-40%,再配精调量化实测可到 3 倍以上 t/s
  • 工具链兼容性不如更大尺寸——9B/12B 这类中间尺寸工具兼容性弱于重号,重型工具任务会想换更大的
  • 不是全能手——选型讨论里社区提醒小尺寸未必全面赢过 gpt,自家基准里 Qwen 系有不少翻车项,榜单第一不等于全方位好用
  • 同款同速在不同 CPU(Intel 与 AMD)上实测结果差异大,体验看硬件与运行环境
  • 已被更新的 3.6 系压过——社区认为 3.6/35B 解题能力优于它,AA 分数 3.6-27B(37)高于 3.5(29),追新玩家直接看 3.6
  • 自报基准需存疑——社区提醒自报数字要打折扣,务必按自己的具体场景做独立验证

可信度6k下载,基于Qwen3.5-9B,MoQ量化在WikiText上优于UnslothDynamic约10%

完整规格

规模
9B · 32k · 权重格式未知,无法估算显存
授权
MIT · 可商用
框架
llama.cpp / llama-cpp-python
血统
量化自 Qwen3.5-9B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 560 → 696 · likes +1

观测时间线

模型家族

查看全部家族 →