模型 / Qwen3.5-9B-MTP-GGUF (unsloth)

Qwen3.5-9B-MTP-GGUF (unsloth)

Qwen3.5-9B 多模态模型,MTP 投机解码,本地快速运行

作者
unsloth
对位
官方 Qwen3.5-9B Transformers 版本
适合
多模态图像理解与文档分析 / 本地 Agent 工具调用场景
不适合
多进程推理或 mmproj 场景
入选理由
GGUF直接可用但需编译llama.cpp;下载量5万+;仅为量化重打包,基础模型虽新但本仓库未增新能力。
规模
9B · 262k (可扩展至1M) · 最低 ~5.4GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / unsloth
血统
量化自 Qwen3.5-9B
国内访问
需代理
可信度
53048次下载,46点赞,MTP解码提速1.5-2倍,Unsloth Dynamic 2.0量化

社区实测

Unsloth 的 Qwen3.5-9B GGUF 量化版本相比官方版本推理速度更快,12GB 显存即可流畅运行且延迟良好;量化鲁棒性强,TQ1_0 等低比特量化几乎无损保留原始精度,但 MMLU Pro 等世界知识类基准上仍有明显退化。

  • 12GB 显存即可部署,延迟表现良好
  • Unsloth 版本推理速度优于 lm-studio 及官方版本
  • TQ1_0 量化几乎无损保留原始模型精度
  • 工具调用和编程性能较此前版本有改进
  • 兼容 llama.cpp、vLLM、SGLang、Unsloth Studio 等多种推理引擎
  • Dynamic 2.0 量化方法进一步降低内存占用
  • MMLU Pro 上退化最明显,世界知识有所损失
  • 量化后模型与原始 16 位版本不完全等同

截至 2026-06-21

本形态 ~5.4GB 4-bit · 国内 需代理 · 53,048 下载

快速上手

git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp && cmake -B build -DGGML_CUDA=ON && cmake --build build --target llama-server

本形态源 ↗

下载动量

30天下载 111.3k → 94.8k · likes +45

观测时间线

模型家族

查看全部家族 →