Gemma-4-31B-it-QAT (Google)
Google 31B QAT 对话模型,GGUF 本地部署
社区实测
Gemma 4 31B QAT 以大幅降低的显存需求保留了接近 bf16 的质量,在长程任务和智能体基准上相比 Gemma 3 有质的飞跃,指令遵循可靠、多语言表现突出。但与 Qwen 3.5 孰优孰劣社区分歧明显,MoE 版本推理速度偏慢,QAT 与标准量化的对比也缺乏公平基准。
- QAT 在显著降低显存需求的同时保留了接近 bf16 的质量
- 长程任务处理能力强,在 FoodTruck Bench 上排名第 3,超过 GLM 5、Qwen 3.5 397B 和所有 Claude Sonnet
- 智能体任务能力从 Gemma 3 的 16.2% 跃升至 76.9%
- 多语言质量突出,在德语、阿拉伯语、越南语、法语等非英语任务中优于 Qwen 3.5
- 复杂指令遵循能力使实际体验比基准测试分数更可靠
- 一次性编程任务得分与 GPT 5.2 和 Gemini 3 Pro Preview 相当
- Apache 2.0 许可证消除了此前 Gemma 系列的使用限制
- 支持 SGLang、vLLM、MLX 等主流工具,可在消费级硬件上本地运行
- 在配合记忆系统使用时会出现丢失系统提示的问题
- 使用工具和自定义框架编程时表现反而不如一次性生成
- QAT Q4 与标准 Q4 的基准对比并非公平比较,结果可能产生误导
- 26B MoE 版本推理速度明显慢于 Qwen 3.5 的同类模型
- W4A16 变体比 Intel Autoround 版本大 4GB
- 社区对是否优于 Qwen 3.5/3.6 存在明显分歧,双方各有支持者
- 纯 CPU 运行 Q8_0 仅约 4 t/s,完整评估需约 13 小时
- 在 Gemma 4 全系列中资源开销和调优复杂度最高
What's your experience with Gemma4 QAT? : r/LocalLLaMA - RedditGemma 4 31B beats several frontier models on the FoodTruck Bench : r/LocalLLaMAGemma 4 31B QAT Q4 vs standard Q4 — Top1 KLD benchmark results have me confused. Someone please explain or poke holes in this. : r/LocalLLaMAAnyone compared Gemma 4 31B : r/artificialHonestly, Gemma 4 feels way better than the benchmarks say - RedditI ran Gemma 4 as a local model in Codex CLI - Hacker NewsGemma4 official QAT models (incl W4A16) - DGX Spark / GB10 ...Google Gemma 4 Model Comparison: How to Choose Between 2B/4B/26B/31BGemma 4 After 24 Hours: What the Community Found vs What ...Gemma 3 Was Dead Last. Gemma 4 Is World-Class. Here's ...google/gemma-4-31B-it-qat-q4_0-unquantized · Hugging FaceGemma 4 with quantization-aware training - Google Blog
截至 2026-06-21
快速上手
llama.cpp: ./llama-cli -m gemma-4-31b-it-qat-q4_0.gguf