此页是 2026-06-07 的观测快照,查看该模型当前信息 → /m/lmstudio-community__gemma-4-12b-it-qat-gguf/

归档 / 2026-06-07 / gemma-4-12B-it-qat-GGUF (Unsloth)

gemma-4-12B-it-qat-GGUF (Unsloth)

Google Gemma 4 12B QAT GGUF,本地多模态推理

入选理由
Gemma 4 12B 多模态 QAT GGUF,支持文本/图像/音频输入,256K上下文,Ollama即用,适合本地多模态部署。
对位
对位 Qwen2.5-VL-7B / Llama-4-Scout-17B
适合
多模态文档理解与OCR / 代码生成与推理
不适合
移动端低内存设备
规模
12B · 256K
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 gemma-4-12B-it-qat-q4_0-unquantized
可信度
Google Gemma 4 QAT,14.6k 下载,MMLU Pro 77.2%,AIME 2026 77.5%

社区实测

社区普遍认为这是目前性价比极高的本地编程模型,QAT 让低比特量化后质量损失极小,在消费级显卡上能跑到 70+ t/s。Q5_K_XL 被多位用户推荐为日常主力,兼顾速度与代码质量。部署门槛低,2-bit 仅 4.66 GB,16GB 显存即可运行。

  • 大幅降低显存需求,可在 16GB 消费级 GPU 上本地运行 12B 模型
  • 2-bit 量化仅占 4.66 GB 磁盘空间,部署门槛极低
  • Q4_K_M 量化在 RTX 4080 Super 上可达 72.3 t/s 生成速度
  • QAT 训练使 4-bit 格式内存占用降低约 72% 同时保持接近原始性能
  • 开箱即用,设置缓存和上下文长度后即可接入工作流
  • Q5_K_XL 量化下多数编程任务可一次通过,减少反复修改
  • 支持 llama.cpp、Ollama、Transformers 等主流本地推理工具
  • MTP(多 token 预测)在 llama.cpp 中的支持仍在开发中,尚未就绪
  • UD 量化格式比标准格式大约 10%,速度慢 1-5%
  • Unsloth 版本本质上是转换 Google 官方 QAT,并非独立改进
  • Q8_0 量化速度骤降至 25.2 t/s,相比 Q4_K_M 的 72.3 t/s 差距明显
  • 从 Q4 升到 Q5 后速度从 61 t/s 降至 50 t/s,需权衡质量与速度

截至 2026-06-21

快速上手

llama.cpp:./llama-cli -m gemma-4-12B-it-qat-Q4_K_M.gguf

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   1 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-06-07)

作者
unsloth
任务类型
any-to-any
推理库
transformers
下载
14,681
点赞
98
许可证
Apache-2.0
标签
transformers, gguf, gemma4, unsloth, gemma, google, any-to-any, base_model:google/gemma-4-12B-it-qat-q4_0-unquantized, base_model:quantized:google/gemma-4-12B-it-qat-q4_0-unquantized, license:apache-2.0, endpoints_compatible, region:us, conversational

探索

源链接