模型 / Gemma-4-12B-it-LWQ6 (wepiqx)

Gemma-4-12B-it-LWQ6 (wepiqx)

混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成

作者
wepiqx
对位
对位Unsloth UD-Q4_K_XL量化版及同类12B量化模型
适合
8GB显存本地代码生成 / 混合量化高效率推理
不适合
需全精度BF16或16GB+显存场景
入选理由
Gemma 4 12B的4-bit混合量化版,GGUF格式可用llama.cpp/Ollama在8GB显卡本地跑,适合低显存用户部署,但仅作者自测无第三方验证。
规模
12B · 最低 ~13GB · 8-bit(估算)
授权
Apache-2.0 · 需自查
框架
llama.cpp / ollama
国内访问
需代理
可信度
自报Wikitext-2 PPL 489.69,低于Unsloth UD-Q4_K_XL (513.11),1420下载

社区实测

Gemma 4 12B 被社区视为当前性价比突出的本地编码模型,在 16GB 笔记本/消费级 GPU 上以 Q4/Q5 量化可跑到 50-72 t/s,实际表现接近 26B 级别。但工具调用(tool calling)可靠性差,Qwen3.5-9B 在多数 benchmark 上仍领先,且 Q8 量化速度骤降。

  • Q4_K_M 量化在 RTX 4080 Super 上生成速度达 72.3 t/s,满足交互式本地使用
  • Q5_K_XL 量化下多数编码任务可一次通过(one-shot),50 t/s 可用
  • 即插即用:设置 cache、锁定 context length 后接入 PI harness 即可运行
  • 多语言质量扎实,在德语、阿拉伯语、越南语、法语等非英语任务上优于 Qwen 3.5
  • Apache 2.0 许可证,无使用限制
  • LWQ6 量化专为 Pascal 老卡(GTX 1070/1080 Ti)优化,8GB 显存可跑,速度与质量均优于 Unsloth UD-Q4_K_XL
  • 12B QAT 版本在创意写作上表现最佳
  • heretic 版本可连续生成 4,372 token(467 行游戏代码),18.76 t/s
  • 12B 以近一半显存接近 26B-A4B 的表现,适合 16GB 笔记本
  • 工具调用不可靠:反复无法正确指定 grep 的 pattern 参数,调用被拒绝
  • Qwen3.5-9B 在 8 项 benchmark 中赢了 5 项,尽管参数量更小
  • Q8_0 量化生成速度仅 25.2 t/s,远低于 Q4_K_M 的 72.3 t/s
  • MTP/assistant model 的 GGUF 量化尚未就绪,llama.cpp 支持仍在开发中
  • 官方模型存在拒答问题,需使用 heretic 等去审查版本
  • 受显存限制时需关闭 thinking mode 才能运行 12B 模型
  • Q5 量化下仍可能出现大量语法错误(一个文件需 23 次编辑)
  • MoE 变体(26B-A4B)运行速度显著慢于 Qwen 3.5 同类模型

截至 2026-06-21

本形态 ~13GB 8-bit · 国内 需代理 · 1,420 下载

快速上手

llama-server -hf wepiqx/gemma-4-12B-it-LWQ6-GGUF:gemma-4-12b-it-LWQ6-IQ4_XS.gguf --jinja --flash-attn on -c 55555 -ngl 99

本形态源 ↗

下载动量

30天下载 3.7k → 545

观测时间线