模型 / Gemma-4-31B-QAT-GGUF (unsloth)

Gemma-4-31B-QAT-GGUF (unsloth)

Gemma 4 31B 量化图文模型,支持工具调用,本地部署

作者 unsloth

仓库标识unsloth/gemma-4-31B-it-qat-GGUF

显存未知许可 可商用任务 视觉理解最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
LLAMA-SERVER
下载
64,518

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL --spec-type draft-mtp --spec-draft-n-max 4 -ngl 999

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Gemma 4 31B 的 QAT GGUF 版,可直接在 llama.cpp 运行,支持多模态与 256K 长上下文,推理能力强,适合本地部署。
对位
对位 Qwen2.5-VL-32B 与 Llama 4 Scout
适合
多模态图文理解与工具调用 / 256K 长上下文推理
不适合
低延迟纯文本对话(小模型更佳)

独立证据与社区反馈

10 个独立来源 · 另 2 官方/转载最近验证 2026-08-09

社区整体认可 Unsloth 的 QAT 量化:4-bit 下仍能保留接近原版的精度(top-1 与 BF16 一致率约 96.7%),显存占用比标准 int4 再省约 72%,实测明显优于 Google 官方朴素 Q4_0,是显存受限时兼顾质量与省显存的性价比之选;但个别实测反映数学、指令遵循与工具调用不如 Q8 高精度量化,口碑存在分化。

  • 4-bit 下保留接近原版的精度:QAT Q4_K_XL 与 QAT BF16 的 top-1 token 一致率约 96.7%
  • 大幅降低显存占用:官方称较标准 int4 少用约 72% 内存,同时接近原始精度
  • 明显优于 Google 官方朴素的 Q4_0 GGUF,社区认为 Q5 以上动态量化的质量差距更明显
  • 相比其他厂商的量化表现更好(如明显优于 Poolside 的 Laguna S Q4)
  • QAT 方案在真实应用中更能保留关键信息,社区评价优于普通静态量化
  • 提供 MTP 版本,带来明显推理提速(官方称 35%/53%)
  • 4-bit Dynamic QAT 在 5-shot MMLU 上表现更好且体积更小
  • 与朴素 Q4_0 在 KL 散度上差距显著(官方 E2B 例为约 29 倍改善)
  • 个别实测 31B QAT 数学能力明显不如 Q8
  • 同样实测反馈忽略系统提示、不调用工具
  • 部分用户质疑专门选用 Unsloth GGUF 的必要性,认为自量化即可
  • 社区对 QAT 与标准量化的对比基准数据存疑,认为需要更严谨验证或挑错
  • 对比结果常被压成单一数字,易导致误读
  • 追求速度时,NVFP4 等方案质量已接近 unsloth Q3 且快得多(如 GB10 等带宽受限设备)
  • 与 Qwen3.6-27B 等主流竞品的选择之争仍缺社区实证结论

可信度下载量 64k+,基于 Google 官方 QAT 量化,Unsloth 社区维护

完整规格

规模
31B · 256k · 权重格式未知,无法估算显存
授权
apache-2.0 · 可商用
框架
llama.cpp
血统
量化自 gemma-4-31B-it-qat-q4_0-unquantized
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 665.6k → 679.3k · likes +16

观测时间线