SummFlow 2026-06-20 Hugging Face

gemma-4-12B-agentic-v2 (yuxinlu1)

本地离线编码与工具使用Agent,仅需4.5GB显存即可运行

入选理由
基于Gemma 4的编码与代理专用微调,GGUF量化可本地运行(最低5.7GB),在工具使用基准上提升3.5倍,适合开发者本地私有编码助手。需最新llama.cpp。
对位
对位原版gemma-4-12B-it及Qwen2.5-Coder-14B
适合
终端命令执行与调试 / 代码编写与多步工具调用
不适合
通用客服或百科问答
规模
12B · 16k(示例命令)
授权
Apache-2.0 · 需自查
框架
llama.cpp
工具调用
Gemma 4 原生工具调用协议(需--jinja)
可信度
点赞93,tau2-bench telecom得分55%(原base 15%),3.5倍提升

社区实测

社区口碑分化:部分用户在 agentic coding 场景下体验良好,Q4/Q5 量化在消费级 GPU 上速度可用;但工具调用在不同框架下表现不稳定,Q8 量化速度明显下降。

  • agentic coding 任务表现良好,有用户称一次通过测试
  • 可在单张 RTX 3090 24G 或 4080 Super 16G 上运行
  • Q4/Q5 量化推理速度在消费级 GPU 上可用(50-72 t/s)
  • 开箱即用,配置简单
  • Q5 量化下仍有语法错误,一个文件需 23 次编辑修正
  • Q8 量化推理速度显著下降(约 25 t/s)
  • 在 OpenCode 等框架中工具调用失败,仅返回空回复
  • assistant 模型尚无 GGUF 量化版本,MTP 支持仍在开发中

截至 2026-06-21

快速上手

llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -m gemma4-v2-Q4_K_M.gguf --ctx-size 16384 --n-gpu-layers 99 --jinja