SummFlow 2026-06-04 Hugging Face

gemma-4-12B-it (Google)

Google Gemma 4 12B 指令模型,GGUF 量化版本

入选理由
Gemma 4 12B的GGUF量化版,可直接用LM Studio运行。
对位
对位 Llama-3-8B / Qwen2.5-14B
适合
本地离线聊天与问答 / 指令遵循与工具调用
不适合
多模态或极长上下文
规模
12B · 未知
授权
Apache 2.0 · 可商用
框架
llama.cpp / LM Studio / ollama
血统
量化自 gemma-4-12B-it
可信度
Google 官方 Gemma 4 12B,Apache 2.0

社区实测

社区普遍认可其无编码器多模态架构设计简洁,但实测中 26B-A4B MoE 变体在各项场景均优于 12B 且速度更快,编码能力则明显偏弱。

  • 无编码器架构降低了音视觉输入处理的延迟与内存占用
  • Q4 量化后仅需约 9 GB 显存即可运行
  • 综合表现优于全精度 9B 级别模型
  • 同家族 26B-A4B 变体在各场景均胜出且推理速度快约 1.7 倍
  • 未针对编码任务训练,编码能力弱
  • 社区建议编码场景搭配 Qwen 等模型做混合方案

截至 2026-06-19

快速上手

ollama: ollama run hf.co/lmstudio-community/gemma-4-12B-it-GGUF:Q4_K_M