gemma-4-12B-agentic-v2 (yuxinlu1)
本地离线编码与工具使用Agent,仅需4.5GB显存即可运行
社区实测
社区口碑分化:部分用户在 agentic coding 场景下体验良好,Q4/Q5 量化在消费级 GPU 上速度可用;但工具调用在不同框架下表现不稳定,Q8 量化速度明显下降。
- agentic coding 任务表现良好,有用户称一次通过测试
- 可在单张 RTX 3090 24G 或 4080 Super 16G 上运行
- Q4/Q5 量化推理速度在消费级 GPU 上可用(50-72 t/s)
- 开箱即用,配置简单
- Q5 量化下仍有语法错误,一个文件需 23 次编辑修正
- Q8 量化推理速度显著下降(约 25 t/s)
- 在 OpenCode 等框架中工具调用失败,仅返回空回复
- assistant 模型尚无 GGUF 量化版本,MTP 支持仍在开发中
来源
Is Gemma 4 12b good for coding? : r/LocalLLaMA - RedditGemma 4 12B is my new main squeeze : r/LocalLLaMA - RedditGemma 4 12B: A unified, encoder-free multimodal modelGemma 4 12B first coding agent test on a 4080 Super : r/LocalLLaMA
截至 2026-06-21
快速上手
llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -m gemma4-v2-Q4_K_M.gguf --ctx-size 16384 --n-gpu-layers 99 --jinja