Gemma-4-12B-it-LWQ6 (wepiqx)
混合量化Gemma-4-12B,8GB显存Pascal GPU代码生成
社区实测
Gemma 4 12B 被社区视为当前性价比突出的本地编码模型,在 16GB 笔记本/消费级 GPU 上以 Q4/Q5 量化可跑到 50-72 t/s,实际表现接近 26B 级别。但工具调用(tool calling)可靠性差,Qwen3.5-9B 在多数 benchmark 上仍领先,且 Q8 量化速度骤降。
- Q4_K_M 量化在 RTX 4080 Super 上生成速度达 72.3 t/s,满足交互式本地使用
- Q5_K_XL 量化下多数编码任务可一次通过(one-shot),50 t/s 可用
- 即插即用:设置 cache、锁定 context length 后接入 PI harness 即可运行
- 多语言质量扎实,在德语、阿拉伯语、越南语、法语等非英语任务上优于 Qwen 3.5
- Apache 2.0 许可证,无使用限制
- LWQ6 量化专为 Pascal 老卡(GTX 1070/1080 Ti)优化,8GB 显存可跑,速度与质量均优于 Unsloth UD-Q4_K_XL
- 12B QAT 版本在创意写作上表现最佳
- heretic 版本可连续生成 4,372 token(467 行游戏代码),18.76 t/s
- 12B 以近一半显存接近 26B-A4B 的表现,适合 16GB 笔记本
- 工具调用不可靠:反复无法正确指定 grep 的 pattern 参数,调用被拒绝
- Qwen3.5-9B 在 8 项 benchmark 中赢了 5 项,尽管参数量更小
- Q8_0 量化生成速度仅 25.2 t/s,远低于 Q4_K_M 的 72.3 t/s
- MTP/assistant model 的 GGUF 量化尚未就绪,llama.cpp 支持仍在开发中
- 官方模型存在拒答问题,需使用 heretic 等去审查版本
- 受显存限制时需关闭 thinking mode 才能运行 12B 模型
- Q5 量化下仍可能出现大量语法错误(一个文件需 23 次编辑)
- MoE 变体(26B-A4B)运行速度显著慢于 Qwen 3.5 同类模型
来源
Gemma 4 12B: A unified, encoder-free multimodal modelGemma 4 12B is my new main squeeze : r/LocalLLaMA - RedditNew Google Gemma 4 12B Claims Near-26B Performance - Redditgemma-4-12b-it vs Qwen3.5-9B on shared benchmarks - RedditGemma 4 12b 8Q Heretic Oneshot Coding : r/LocalLLaMAGemma 4 12B: incompatible with opencode, or just awful at tool ...Tested Gemma 4 (12B QAT & Q4_K_M & E4B). Here's what ...wepiqx/gemma-4-12B-it-LWQ6-GGUF · Hugging FaceGemma 4 After 24 Hours: What the Community Found vs What ...
截至 2026-06-21
快速上手
llama-server -hf wepiqx/gemma-4-12B-it-LWQ6-GGUF:gemma-4-12b-it-LWQ6-IQ4_XS.gguf --jinja --flash-attn on -c 55555 -ngl 99