模型 / Gemma-4-31B-QAT-GGUF (unsloth)

Gemma-4-31B-QAT-GGUF (unsloth)

Gemma 4 31B 量化图文模型,支持工具调用,本地部署

作者
unsloth
对位
对位 Qwen2.5-VL-32B 与 Llama 4 Scout
适合
多模态图文理解与工具调用 / 256K 长上下文推理
不适合
低延迟纯文本对话(小模型更佳)
入选理由
Gemma 4 31B 的 QAT GGUF 版,可直接在 llama.cpp 运行,支持多模态与 256K 长上下文,推理能力强,适合本地部署。
规模
31B · 256k · 最低 ~19GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp
血统
量化自 gemma-4-31B-it-qat-q4_0-unquantized
国内访问
需代理
可信度
下载量 64k+,基于 Google 官方 QAT 量化,Unsloth 社区维护

社区实测

社区普遍认为 Unsloth 的 QAT GGUF 量化是 Gemma 4 31B 目前最好的 GGUF 版本:KL 散度基准中 Unsloth UD 量化几乎垄断 Pareto 前沿,QAT Q4 以约 72% 更低的内存占用换取接近 bf16 的质量,让 31B 在消费级 GPU 上可用。部分用户主观感觉 QAT Q4 比 Q5/Q6 非 QAT 略差,但速度提升明显;长文档和非拉丁文字在所有量化级别下退化最快。

  • QAT Q4 内存占用降低约 72%,质量接近 bf16,使 31B 可在 16GB 消费级 GPU 上运行
  • Unsloth UD 量化在 KL 散度基准中 8/9 个位于 Pareto 前沿,26B-A4B 的 22 个尺寸全部排名第一
  • Unsloth 发现直接转换 QAT checkpoint 到 Q4_0 GGUF 会损失精度,通过动态处理修复了这一问题
  • MTP GGUF 权重已发布,可使用不同 draft model 获得推理加速(实测 26B-A4B q2 作 drafter 获得 3x 加速)
  • 支持 llama.cpp、vLLM、SGLang、Transformers 等主流推理框架
  • Apache 2.0 许可证,允许商用
  • 31B 稠密版在榜单上与 Kimi K2.5 (744B-A40B) 和 GLM-5 (1T-A32B) 并列顶级开源模型
  • QAT Q4 与标准 Q4 的基准对比并非同类比较(参考模型不同),不能直接解读为 QAT 优于标准量化
  • KL 散度仅衡量量化损伤抵抗程度,不代表 QAT Q4 模型的绝对智能水平等同于原始 bf16 模型
  • 长文档和非拉丁文字在所有量化级别下退化最快,即使 Q8_0 也有明显 KL 散度
  • 滑动窗口注意力加 KV cache 复用架构可能在低精度长上下文下累积误差
  • 有用户主观认为 QAT Q4 比之前用的 Q5/Q6 非 QAT 略差
  • Google 官方直接转换的 QAT Q4_0 GGUF 精度反而不如 Unsloth 动态处理版本
  • MTP 与 QAT 的整合仍在演进,社区期待 QAT Q4_K_XL MTP GGUF 搭配可用的 .mmproj 在 LM Studio 中运行

截至 2026-06-21

本形态 ~19GB 4-bit · 国内 需代理 · 64,518 下载

快速上手

llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999

本形态源 ↗

下载动量

30天下载 304.1k → 277.8k · likes +52

观测时间线