模型 / gemma-4-12B-it (Google)

gemma-4-12B-it (Google)

12B 多模态模型,支持图文音频输入,本地 GGUF 量化部署

作者 lmstudio-community

仓库标识lmstudio-community/gemma-4-12B-it-GGUF

显存未知许可 可商用任务 视觉理解最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
llama.cpp
下载
124

Hugging Face 源仓库 ↗

适合与不适合

入选理由
Google 最新多模态模型,GGUF格式即下即用。
对位
对位 Qwen2.5-VL-7B / Pixtral 12B
适合
本地多模态聊天 / OCR 与文档理解
不适合
资源受限移动设备

独立证据与社区反馈

12 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

Gemma 4 12B 社区口碑是「以小搏大」:能在很低的显存/内存上跑起来,12B 尺寸的智能表现被普遍认为超出预期(如 MMLU Pro 上超过上一代 27B 级),速度和工具/多模态能力也得到认可。但共识强调必须搭配正确的量化(Unsloth Dynamic / QAT)与合理的推理设置,官方 naive Q4_0 或默认参数会被认为明显拉低体验。

  • 超低资源本地运行:4-bit 的 Gemma 4 E4B 可在 6GB RAM 上本地执行 Bash 代码与工具调用,也能联网搜索。
  • 多模态一体化:12B GGUF 通过 mmproj 新增 vision 与 audio 支持,原生处理文本/图像/音频/视频。
  • 更高保真量化:Unsloth Dynamic(UD)量化被验证在压缩时保留更高精度,社区普遍认为优于官方 naive Q4_0 转换。
  • 省显存留上下文:社区建议使用 QAT 版本,让模型占用更少 VRAM,把更多显存留给上下文。
  • 推理加速:Unsloth 的 MTP 支持被社区认为能带来更快的生成速度。
  • 编程/排查能力:在社区进行的 Python bug hunting 基准中表现良好,12B 就具备不错的问题定位能力。
  • 低门槛运行与训练:可通过 Unsloth Studio 直接运行和微调该模型。
  • 直观收益:MMLU Pro 成绩超过上一代 27B 级模型,性价比感知明显。
  • 多轮对话后会出现奇怪的循环(looping)现象,影响长对话体验。
  • 官方 naive Q4_0 GGUF 被指丢失原始 safetensors 中的质量,需换用 Dynamic 量化版本。
  • Ollama 生态只提供官方少量量化,社区认为用 Hugging Face 上的量化更优化、选择更自由。
  • 本地默认推理设置可能反而拉低表现,需要手动调优才能发挥模型实力。
  • 多模态输入有限制:音频最长 30 秒,视频最长 60 秒(按 1fps 处理)。

可信度Google DeepMind 发布,Apache 2.0,78 社区点赞,Unsloth Dynamic 2.0 量化

完整规格

规模
12B · 256k · 权重格式未知,无法估算显存
授权
Apache 2.0 · 可商用
框架
llama.cpp / ollama / transformers
血统
量化自 gemma-4-12B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 148.9k → 136.3k · likes +2

观测时间线

模型家族

查看全部家族 →