Gemma-4-31B-QAT-GGUF (unsloth)
Gemma 4 31B 量化图文模型,支持工具调用,本地部署
社区实测
社区普遍认为 Unsloth 的 QAT GGUF 量化是 Gemma 4 31B 目前最好的 GGUF 版本:KL 散度基准中 Unsloth UD 量化几乎垄断 Pareto 前沿,QAT Q4 以约 72% 更低的内存占用换取接近 bf16 的质量,让 31B 在消费级 GPU 上可用。部分用户主观感觉 QAT Q4 比 Q5/Q6 非 QAT 略差,但速度提升明显;长文档和非拉丁文字在所有量化级别下退化最快。
- QAT Q4 内存占用降低约 72%,质量接近 bf16,使 31B 可在 16GB 消费级 GPU 上运行
- Unsloth UD 量化在 KL 散度基准中 8/9 个位于 Pareto 前沿,26B-A4B 的 22 个尺寸全部排名第一
- Unsloth 发现直接转换 QAT checkpoint 到 Q4_0 GGUF 会损失精度,通过动态处理修复了这一问题
- MTP GGUF 权重已发布,可使用不同 draft model 获得推理加速(实测 26B-A4B q2 作 drafter 获得 3x 加速)
- 支持 llama.cpp、vLLM、SGLang、Transformers 等主流推理框架
- Apache 2.0 许可证,允许商用
- 31B 稠密版在榜单上与 Kimi K2.5 (744B-A40B) 和 GLM-5 (1T-A32B) 并列顶级开源模型
- QAT Q4 与标准 Q4 的基准对比并非同类比较(参考模型不同),不能直接解读为 QAT 优于标准量化
- KL 散度仅衡量量化损伤抵抗程度,不代表 QAT Q4 模型的绝对智能水平等同于原始 bf16 模型
- 长文档和非拉丁文字在所有量化级别下退化最快,即使 Q8_0 也有明显 KL 散度
- 滑动窗口注意力加 KV cache 复用架构可能在低精度长上下文下累积误差
- 有用户主观认为 QAT Q4 比之前用的 Q5/Q6 非 QAT 略差
- Google 官方直接转换的 QAT Q4_0 GGUF 精度反而不如 Unsloth 动态处理版本
- MTP 与 QAT 的整合仍在演进,社区期待 QAT Q4_K_XL MTP GGUF 搭配可用的 .mmproj 在 LM Studio 中运行
Unsloth just dropped MTP GGUF weights for Gemma 4! - RedditGemma 4 31B GGUF quants ranked by KL divergence ... - RedditGemma 4 QAT GGUFs from Unsloth : r/LocalLLaMA - RedditUnsloth Gemma 4 QAT MTP assistant models now available - RedditGemma 4 31B QAT Q4 vs standard Q4 — Top1 KLD ... - RedditGemma 4 QAT | Unsloth DocumentationGemma 4 31B GGUF Quality Benchmark: unsloth, bartowski ...Unsloth AI on X: "We benchmarked Gemma 4 26B-A4B GGUFs ..." / XGoogle Official QAT vs. Unsloth Version: Which Gemma 4 12B is Superior? — A Serious Test in My Own Environment [Part 1]|zephel01[AINews] Gemma 4: The best small Multimodal Open Models ...
截至 2026-06-21
本形态 ~19GB 4-bit · 国内 需代理 · 64,518 下载
快速上手
llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999 本形态 ~19GB 4-bit · 国内 需代理 · 45,613 下载
快速上手
huggingface_hub download google/gemma-4-31B-it-qat-q4_0-gguf 本形态 ~19GB 4-bit · 国内 需代理 · 7,171 下载
快速上手
llama.cpp: ./llama-cli -m gemma-4-31b-it-qat-q4_0.gguf