此页是 2026-06-07 的观测快照,查看该模型当前信息 → /m/lmstudio-community__gemma-4-12b-it-qat-gguf/

归档 / 2026-06-07 / Gemma-4-12B-it-QAT-Q4_0 (Google)

Gemma-4-12B-it-QAT-Q4_0 (Google)

Gemma 4 12B GGUF 量化版,本地多模态推理。

入选理由
Google最新Gemma 4 12B多模态模型,支持文本/图像/音频,256K上下文,以GGUF量化格式可直接在Ollama/llama.cpp中运行,适合本地高性能部署。
对位
对位 Gemma 3 12B / Llama 4 Scout
适合
多模态对话与长文本理解 / 本地量化推理与移动端部署
不适合
需要全精度 BF16 的场景
规模
12B · 256K
授权
Apache 2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 gemma-4-12B-it-qat-q4_0-unquantized
可信度
4674 下载,63 点赞,Apache 2.0,Google DeepMind 发布。

社区实测

QAT 大幅降低显存占用且质量接近 bf16,创意写作表现突出,但工具调用不可靠、thinking 模式在不同后端行为不一致,对编程等特定场景可能是退步。12B 性能接近 26B 基准水平,可在消费级硬件上运行。

  • QAT 在压缩模型时大幅降低内存需求,使 12B 模型可在消费级 GPU 和笔记本上运行
  • 创意写作是 12B QAT 表现最好的场景
  • 原生多模态:无需独立编码器即可处理文本、图像、音频和视频
  • 常规 Q5_K_L 量化版本编程能力扎实,可生成 2300 行经过调试和测试的代码
  • 12B 模型性能接近 26B 基准水平
  • QAT 在训练中模拟量化,压缩后质量损失远小于训练后量化
  • QAT 版本应是最优的 Q4 量化版本
  • 工具调用(tool calling)不一致,有用户尝试数天后放弃
  • thinking 模式在不同后端行为不一致,Unsloth Studio 上即使禁用仍会持续思考,只能通过 llama.cpp 命令行可靠关闭
  • QAT 版本对某些用例是退步,不如常规量化版本
  • 强视觉和音频理解与本地可运行的小体积难以兼得
  • AI 基准评分(9 分)低于 GPT-4o Mini(13 分)和 Claude 3.5 Haiku(19 分)
  • 受 VRAM 限制,12B 模型可能需要关闭 thinking 模式才能运行

截至 2026-06-21

快速上手

ollama run hf.co/google/gemma-4-12B-it-qat-q4_0-gguf

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   5 / 5
总分
13

HuggingFace 原始数据 (抓取于 2026-06-07)

作者
google
任务类型
any-to-any
推理库
transformers
下载
4,674
点赞
63
许可证
Apache 2.0
标签
transformers, gguf, any-to-any, base_model:google/gemma-4-12B-it-qat-q4_0-unquantized, base_model:quantized:google/gemma-4-12B-it-qat-q4_0-unquantized, license:apache-2.0, endpoints_compatible, region:us, conversational

探索

源链接