模型 / Qwen3.5-9B-MTP-GGUF (unsloth)

Qwen3.5-9B-MTP-GGUF (unsloth)

Qwen3.5-9B 多模态模型,MTP 投机解码,本地快速运行

作者 unsloth

仓库标识unsloth/Qwen3.5-9B-MTP-GGUF

显存未知许可 可商用任务 视觉理解最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
CMD
下载
53,048

Hugging Face 源仓库 ↗

快速上手示例

./llama.cpp/build/bin/llama-server -hf unsloth/Qwen3.5-9B-MTP-GGUF:UD-Q4_K_XL -ngl 99 -fa on --spec-type draft-mtp

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
GGUF直接可用但需编译llama.cpp;下载量5万+;仅为量化重打包,基础模型虽新但本仓库未增新能力。
对位
官方 Qwen3.5-9B Transformers 版本
适合
多模态图像理解与文档分析 / 本地 Agent 工具调用场景
不适合
多进程推理或 mmproj 场景

独立证据与社区反馈

10 个独立来源最近验证 2026-08-09

Unsloth 的 Qwen3.5-9B MTP GGUF 在低显存部署(Q4_K_L 仅约 6GB)和结构化输出加速上性价比突出,是 MTP 尝鲜的便捷选择;但 9B 及以下尺寸存在多轮对话后输出乱码的可靠性问题,速度上比 Bartowski 量化「笨」但推理更快,q8_0 是社区公认的免费午餐级量化。

  • MTP 对结构化输出(编程、JSON、HTML)加速效果显著,优于通用叙事对话
  • UD-Q4_K_L / Q4_K_L 量化仅需约 6GB 显存,性能接近原始模型
  • Unsloth GGUF 推理速度比 lm-studio 等方案更快
  • Unsloth 量化在 KL 散度指标上排名靠前,量化精度有保障
  • 可在 Unsloth Studio 中直接加载使用,上手门槛低
  • q8_0 量化是社区公认的「免费午餐」级选择,质量损失极小
  • 0.8B–9B 尺寸模型在 2–3 轮对话后输出乱码,可靠性存疑
  • MTP 对通用叙事/闲聊对话的加速效果不明显
  • Unsloth GGUF 比同类量化慢约 30%,且后续回复处理时间更长
  • Unsloth Studio 更新后可能导致 MTP 功能突然失效
  • Bartowski 量化在输出质量/「聪明程度」上优于 Unsloth 量化
  • q4_0 量化质量较差,不推荐使用
  • 长上下文会显著降低工具调用性能
  • 未启用 MTP 的旧版 GGUF/MLX 中 MTP 层闲置浪费 VRAM
  • MLX 模型质量明显不如 GGUF,不推荐使用
  • Imatrix 量化虽降低 KLD/PPL,但推理速度会降低 5–10%

可信度53048次下载,46点赞,MTP解码提速1.5-2倍,Unsloth Dynamic 2.0量化

完整规格

规模
9B · 262k (可扩展至1M) · 权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
llama.cpp / unsloth
血统
量化自 Qwen3.5-9B
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 76.7k → 71.2k · likes +12

观测时间线

模型家族

查看全部家族 →