Gemma-4-12B-it-QAT (Google)
Google Gemma 4 12B QAT GGUF,本地多模态推理
仓库标识lmstudio-community/gemma-4-12B-it-QAT-GGUF
显存未知许可 可商用最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(GGUF·lmstudio)。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- LLAMA-SERVER
- 下载
- 19,381
快速上手示例
llama-server -hf lmstudio-community/gemma-4-12B-it-QAT-GGUF 依赖版本和硬件参数请以源仓库说明为准。
- 格式
- 4-bit
- 文件
- ~6.3GB
- 运行内存
- ~7.2GB–9.4GB
- 运行时
- OLLAMA
- 下载
- 4,674
快速上手示例
ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf 依赖版本和硬件参数请以源仓库说明为准。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- llama.cpp
- 下载
- 14,681
适合与不适合
独立证据与社区反馈
Unsloth 的 Gemma 4 12B QAT GGUF 社区评价整体积极,实测稳定可靠。文件比 Google 官方 Q4_0 GGUF 更小(6.72GB vs 6.98GB),4-bit 量化下精度接近 BF16(MMLU 67.07% vs 67.15%),prompt 处理速度比 Google 版本快约 17%。但偶尔出现离谱回复,工具调用存在重复调用同一工具的问题。
- 文件体积比 Google 官方 Q4_0 GGUF 更小(6.72GB vs 6.98GB),下载更轻量
- 4-bit 量化下精度接近 BF16,MMLU 得分几乎无退化(67.07% vs 67.15%)
- 推理速度快,RTX 5090 上轻松超过 140 t/s
- 显存占用低,12B Q4 约 7GB,剩余大量显存可用于长上下文
- Prompt 处理速度比 Google 官方 QAT GGUF 快约 17%
- Unsloth Dynamic 量化方法比朴素 Q4_0 转换的字节精确度大幅提升(99.96% vs 24.77%)
- 工具调用能力在实际使用中可用,能成功调用多个工具
- 社区多轮实测后评价为「rock solid」,稳定性获认可
- 偶尔会出现一条离谱或搞笑的回复,质量不稳定
- 存在工具调用时反复调用同一工具的问题
- 朴素 Q4_0 直接转换效果不够好,需依赖 Unsloth 的动态量化方法
- MTP drafter 的 llama.cpp 支持仍在开发中,尚未就绪
- Unsloth 版本并未改进 QAT 本身,只是将 Google 的 QAT 权重转换为 GGUF 格式
- 与 Google 官方版本生成内容细节有差异,温度等采样参数即可影响表现差异
- 社区实测Gemma 4 QAT GGUFs from Unsloth : r/LocalLLaMA
- 社区实测Unsloth Gemma 4 QAT MTP assistant models now available
- 社区实测Gemma 4 QAT models: Optimizing compression for mobile ...
- 独立评测Google QAT vs Unsloth Q4_0 - Which Gemma 4 12B Quantization Is Better?
- 社区实测2-bit Gemma 4 12B GGUF is amazing! (4.66 GB on disk) : r ...
- 独立评测Gemma 4 QAT | Unsloth Documentation
- 社区实测QATs Q4_0 from Google have more precision than ...
- 独立评测Google Official QAT vs. Unsloth Version: Which Gemma 4 ...
- 独立评测Google QAT vs Unsloth QAT + MTP - Which Gemma 4 12B Is Actually ...
- 转载/仓库unsloth/gemma-4-12B-it-qat-GGUF — Hugging Face
可信度Google Gemma 4 QAT,14.6k 下载,MMLU Pro 77.2%,AIME 2026 77.5%
完整规格
下载动量
30天下载 392.8k → 357.8k · likes +4