模型 / Gemma-4-12B-it-QAT (Google)

Gemma-4-12B-it-QAT (Google)

Google Gemma 4 12B QAT GGUF,本地多模态推理

作者 lmstudio-community

仓库标识lmstudio-community/gemma-4-12B-it-QAT-GGUF

显存未知许可 可商用最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
LLAMA-SERVER
下载
19,381

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf lmstudio-community/gemma-4-12B-it-QAT-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Gemma 4 12B 多模态 QAT GGUF,支持文本/图像/音频输入,256K上下文,Ollama即用,适合本地多模态部署。
对位
对位 Qwen2.5-VL-7B / Llama-4-Scout-17B
适合
多模态文档理解与OCR / 代码生成与推理
不适合
移动端低内存设备

独立证据与社区反馈

9 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

Unsloth 的 Gemma 4 12B QAT GGUF 社区评价整体积极,实测稳定可靠。文件比 Google 官方 Q4_0 GGUF 更小(6.72GB vs 6.98GB),4-bit 量化下精度接近 BF16(MMLU 67.07% vs 67.15%),prompt 处理速度比 Google 版本快约 17%。但偶尔出现离谱回复,工具调用存在重复调用同一工具的问题。

  • 文件体积比 Google 官方 Q4_0 GGUF 更小(6.72GB vs 6.98GB),下载更轻量
  • 4-bit 量化下精度接近 BF16,MMLU 得分几乎无退化(67.07% vs 67.15%)
  • 推理速度快,RTX 5090 上轻松超过 140 t/s
  • 显存占用低,12B Q4 约 7GB,剩余大量显存可用于长上下文
  • Prompt 处理速度比 Google 官方 QAT GGUF 快约 17%
  • Unsloth Dynamic 量化方法比朴素 Q4_0 转换的字节精确度大幅提升(99.96% vs 24.77%)
  • 工具调用能力在实际使用中可用,能成功调用多个工具
  • 社区多轮实测后评价为「rock solid」,稳定性获认可
  • 偶尔会出现一条离谱或搞笑的回复,质量不稳定
  • 存在工具调用时反复调用同一工具的问题
  • 朴素 Q4_0 直接转换效果不够好,需依赖 Unsloth 的动态量化方法
  • MTP drafter 的 llama.cpp 支持仍在开发中,尚未就绪
  • Unsloth 版本并未改进 QAT 本身,只是将 Google 的 QAT 权重转换为 GGUF 格式
  • 与 Google 官方版本生成内容细节有差异,温度等采样参数即可影响表现差异

可信度Google Gemma 4 QAT,14.6k 下载,MMLU Pro 77.2%,AIME 2026 77.5%

完整规格

规模
12B · 256K · 权重格式未知,无法估算显存
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 gemma-4-12B-it-qat-q4_0-unquantized
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 392.8k → 357.8k · likes +4

观测时间线