Gemma-4-12B-it-QAT (Google)
12B开源对话模型QAT量化,可本地CPU/GPU推理
社区实测
Gemma 4 12B 以原生多模态和 16GB 笔记本可运行为最大亮点,编码器-free 架构带来更低延迟和更小内存占用;常规量化版编程表现扎实,但 QAT 版在工具调用上出现倒退,且 MTP 支持尚未就绪,社区整体认为有潜力但当前生态仍不完整。
- 可在 16GB 显存/统一内存的笔记本上完全本地运行,无需云端依赖
- 编码器-free 架构省去独立视觉/音频编码器,降低延迟和内存占用
- 12B 级别模型首次原生支持音频处理
- 编码器-free 设计保留更多低层视觉细节,细粒度 OCR 表现更好
- QAT 量化在大幅降低内存需求的同时保持接近 bfloat16 的质量
- 在几乎一半显存占用下接近 26B 模型的性能表现
- 常规量化版(Q5_K_L)可生成 2300 行经过调试、架构合理且通过测试的代码
- 在可本地运行的体积内同时提供较强的视觉和音频理解能力
- QAT 量化版工具调用不稳定,对部分工作流是明显倒退
- llama.cpp 对 Gemma 4 的 MTP(多 token 预测)支持仍在开发中
- assistant 模型的 GGUF 量化版本尚未发布
- Q8_0 量化版生成速度仅 25.2 t/s,显著慢于 Q4_K_M 的 72.3 t/s
- Qwen3.5-9B 在 8 项共享基准中赢了 5 项,参数更少却整体领先
- QAT 版相比常规 Q5_K_L 版在特定场景下是倒退
Gemma 4 12B: A unified, encoder-free multimodal modelGemma 4 12b QAT is a regression for my use case, despite ... - RedditReddit games AI, Google Gemma 4 runs local, AI bioweaponsGoogle introduces Gemma 4 12B: a unified, encoder-free ... - RedditNew Google Gemma 4 12B Claims Near-26B Performance - RedditIntroducing Gemma 4 12B: a unified, encoder-free multimodal modelGemma 4 12B : Run Locally, Fine-Tune, Benchmark PerformanceGemma 4 12B: Specs, Benchmarks & How to Run It Locallygemma-4-12b-it vs Qwen3.5-9B on shared benchmarks - Redditgoogle/gemma-4-12B-it-qat-q4_0-unquantized · Hugging Face
截至 2026-06-21
快速上手
llama-server -hf lmstudio-community/gemma-4-12B-it-QAT-GGUF