SummFlow 2026-06-07 Hugging Face

Gemma-4-12B-it-QAT (Google)

12B开源对话模型QAT量化,可本地CPU/GPU推理

入选理由
Google 最新 Gemma 4 12B 的 QAT 量化版,GGUF 格式可直接在 LM Studio 运行,适合需要本地部署高性能对话模型的用户。
对位
对位 Llama-3.1-8B / Qwen2.5-7B 对话模型
适合
本地对话与内容生成(Q4量化) / 构建离线AI助手或RAG问答
不适合
复杂数学推理与高精度代码生成
规模
12B · 未知
授权
Apache-2.0 · 可商用
框架
llama.cpp / LM Studio
血统
量化自 gemma-4-12B-it-qat-q4_0-unquantized
可信度
总下载 19,381 次,基于 Google 官方 gemma-4-12B-it 量化

社区实测

Gemma 4 12B 以原生多模态和 16GB 笔记本可运行为最大亮点,编码器-free 架构带来更低延迟和更小内存占用;常规量化版编程表现扎实,但 QAT 版在工具调用上出现倒退,且 MTP 支持尚未就绪,社区整体认为有潜力但当前生态仍不完整。

  • 可在 16GB 显存/统一内存的笔记本上完全本地运行,无需云端依赖
  • 编码器-free 架构省去独立视觉/音频编码器,降低延迟和内存占用
  • 12B 级别模型首次原生支持音频处理
  • 编码器-free 设计保留更多低层视觉细节,细粒度 OCR 表现更好
  • QAT 量化在大幅降低内存需求的同时保持接近 bfloat16 的质量
  • 在几乎一半显存占用下接近 26B 模型的性能表现
  • 常规量化版(Q5_K_L)可生成 2300 行经过调试、架构合理且通过测试的代码
  • 在可本地运行的体积内同时提供较强的视觉和音频理解能力
  • QAT 量化版工具调用不稳定,对部分工作流是明显倒退
  • llama.cpp 对 Gemma 4 的 MTP(多 token 预测)支持仍在开发中
  • assistant 模型的 GGUF 量化版本尚未发布
  • Q8_0 量化版生成速度仅 25.2 t/s,显著慢于 Q4_K_M 的 72.3 t/s
  • Qwen3.5-9B 在 8 项共享基准中赢了 5 项,参数更少却整体领先
  • QAT 版相比常规 Q5_K_L 版在特定场景下是倒退

截至 2026-06-21

快速上手

llama-server -hf lmstudio-community/gemma-4-12B-it-QAT-GGUF