Gemma-4-12B-it-QAT-Q4_0 (Google)
Gemma 4 12B GGUF 量化版,本地多模态推理。
社区实测
QAT 大幅降低显存占用且质量接近 bf16,创意写作表现突出,但工具调用不可靠、thinking 模式在不同后端行为不一致,对编程等特定场景可能是退步。12B 性能接近 26B 基准水平,可在消费级硬件上运行。
- QAT 在压缩模型时大幅降低内存需求,使 12B 模型可在消费级 GPU 和笔记本上运行
- 创意写作是 12B QAT 表现最好的场景
- 原生多模态:无需独立编码器即可处理文本、图像、音频和视频
- 常规 Q5_K_L 量化版本编程能力扎实,可生成 2300 行经过调试和测试的代码
- 12B 模型性能接近 26B 基准水平
- QAT 在训练中模拟量化,压缩后质量损失远小于训练后量化
- QAT 版本应是最优的 Q4 量化版本
- 工具调用(tool calling)不一致,有用户尝试数天后放弃
- thinking 模式在不同后端行为不一致,Unsloth Studio 上即使禁用仍会持续思考,只能通过 llama.cpp 命令行可靠关闭
- QAT 版本对某些用例是退步,不如常规量化版本
- 强视觉和音频理解与本地可运行的小体积难以兼得
- AI 基准评分(9 分)低于 GPT-4o Mini(13 分)和 Claude 3.5 Haiku(19 分)
- 受 VRAM 限制,12B 模型可能需要关闭 thinking 模式才能运行
google/gemma-4-12B-it-qat-q4_0-unquantized · Hugging FaceIntroducing Gemma 4 12B: a unified, encoder-free multimodal modelGemma 4 with quantization-aware training : r/LocalLLaMA - RedditGemma 4 Quadruple Release, 12B, 12B QAT, 26B-A4B QAT and 31B QAT Uncensored Heretics! : r/LocalLLaMATested Gemma 4 (12B QAT & Q4_K_M & E4B). Here's what ... - RedditGemma 4 12b QAT is a regression for my use case, despite ... - RedditGemma 4 12B : Run Locally, Fine-Tune, Benchmark PerformanceGemma 4 with quantization-aware training - Google BlogGemma4 official QAT models (incl W4A16) - DGX Spark / GB10 ...Gemma 4 12B vs GPT-4o Mini vs Claude Haiku [2026 Benchmark]Google Gemma 4 12B nearly matches 26B benchmarks
截至 2026-06-21
快速上手
ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf