SummFlow 2026-06-30 Hugging Face

Gemma-4-12B GGUF 合集 (rahul7star)

Gemma 4 12B/3B GGUF 量化集合,供本地聊天与代码任务

入选理由
提供Gemma-4-12B的GGUF量化版,有在线Space可直接试用,适合需要本地部署或快速体验的开发者。
对位
对位 Mistral-Nemo-12B / Llama-3.1-8B
适合
本机聊天与文本生成 / 代码补全与 Python 代理任务
不适合
文本以外的多模态任务
规模
12B (以及 3B) · 262k
授权
未知 · 需自查
框架
llama.cpp / ollama
血统
量化自 gemma-4-E2B-it
可信度
近 3 月 54k+ 下载,由活跃社区贡献者维护并持续更新 GGUF 量化包

社区实测

Gemma 4 12B GGUF 在消费级硬件上以极低 VRAM 占用(Q4 约 6.6GB)提供了接近 26B 模型的 benchmark 成绩和原生多模态能力,部署门槛低、性价比突出。但在实际编码场景口碑分化,QAT 量化版本存在转换导致的性能倒退问题,部分用户更倾向混合部署方案。

  • 在 8–16GB VRAM 的消费级 GPU 上本地运行接近 26B 级别的模型性能
  • 无需独立编码器的原生多模态输入(文本、图像、音频、视频)
  • Apache 2.0 许可,商用无限制
  • 256K token 上下文窗口
  • 一条 ollama 命令即可本地部署(ollama run gemma4:12b,下载 7.6GB)
  • 2-bit 量化后磁盘占用仅约 4.66GB,极端压缩下仍可运行
  • 在 Python bug 定位等代码审阅任务中表现良好(Q5 量化)
  • MMLU Pro 得分 77.2%,超过上一代 Gemma 3 27B 的 67.6%
  • QAT 量化版本在部分使用场景下性能倒退,从 QAT BF16 转换存在已知问题
  • 官方未将编码作为主要训练目标(公告中未提及编码能力),纯编码场景表现不如专用编码模型
  • 部分用户更倾向将 Gemma 4 与 Qwen 等模型混合使用以弥补编码短板

截至 2026-07-05

快速上手

llama-cli -hf rahul7star/gemma-gguf -m model-i-gemma-e4-12b-quality.gguf