SummFlow 2026-06-07 Hugging Face

Gemma-4-31B-it-QAT (Google)

Google 31B QAT 对话模型,GGUF 本地部署

入选理由
Google 最新 Gemma-4 31B 指令模型的 GGUF 量化版,直接可用 llama.cpp 或 LM Studio 运行,适合需要本地部署最新大模型的开发者,注意 31B 量化仍需要较高显存(约 16-20GB)。
对位
对位 Qwen2.5-32B / Yi-34B
适合
本地聊天机器人部署 / CPU/低显存推理对话
不适合
高精度数学/代码生成
规模
31B · 未知
授权
Apache 2.0 · 可商用
框架
llama.cpp / LM Studio / ollama
血统
量化自 gemma-4-31B-it-qat-q4_0-unquantized
可信度
HF 7.1k 下载,Google QAT 量化转 GGUF,Apache 2.0

社区实测

Gemma 4 31B QAT 以大幅降低的显存需求保留了接近 bf16 的质量,在长程任务和智能体基准上相比 Gemma 3 有质的飞跃,指令遵循可靠、多语言表现突出。但与 Qwen 3.5 孰优孰劣社区分歧明显,MoE 版本推理速度偏慢,QAT 与标准量化的对比也缺乏公平基准。

  • QAT 在显著降低显存需求的同时保留了接近 bf16 的质量
  • 长程任务处理能力强,在 FoodTruck Bench 上排名第 3,超过 GLM 5、Qwen 3.5 397B 和所有 Claude Sonnet
  • 智能体任务能力从 Gemma 3 的 16.2% 跃升至 76.9%
  • 多语言质量突出,在德语、阿拉伯语、越南语、法语等非英语任务中优于 Qwen 3.5
  • 复杂指令遵循能力使实际体验比基准测试分数更可靠
  • 一次性编程任务得分与 GPT 5.2 和 Gemini 3 Pro Preview 相当
  • Apache 2.0 许可证消除了此前 Gemma 系列的使用限制
  • 支持 SGLang、vLLM、MLX 等主流工具,可在消费级硬件上本地运行
  • 在配合记忆系统使用时会出现丢失系统提示的问题
  • 使用工具和自定义框架编程时表现反而不如一次性生成
  • QAT Q4 与标准 Q4 的基准对比并非公平比较,结果可能产生误导
  • 26B MoE 版本推理速度明显慢于 Qwen 3.5 的同类模型
  • W4A16 变体比 Intel Autoround 版本大 4GB
  • 社区对是否优于 Qwen 3.5/3.6 存在明显分歧,双方各有支持者
  • 纯 CPU 运行 Q8_0 仅约 4 t/s,完整评估需约 13 小时
  • 在 Gemma 4 全系列中资源开销和调优复杂度最高

截至 2026-06-21

快速上手

llama.cpp: ./llama-cli -m gemma-4-31b-it-qat-q4_0.gguf