此页是 2026-06-20 的观测快照,查看该模型当前信息 → /m/yuxinlu1__gemma-4-12b-agentic-fable5-composer25-v2-35x-tau2/

归档 / 2026-06-20 / gemma-4-12B-agentic-v2 (yuxinlu1)

gemma-4-12B-agentic-v2 (yuxinlu1)

本地离线编码与工具使用Agent,仅需4.5GB显存即可运行

入选理由
基于Gemma 4的编码与代理专用微调,GGUF量化可本地运行(最低5.7GB),在工具使用基准上提升3.5倍,适合开发者本地私有编码助手。需最新llama.cpp。
对位
对位原版gemma-4-12B-it及Qwen2.5-Coder-14B
适合
终端命令执行与调试 / 代码编写与多步工具调用
不适合
通用客服或百科问答
规模
12B · 16k(示例命令)
授权
Apache-2.0 · 需自查
框架
llama.cpp
工具调用
Gemma 4 原生工具调用协议(需--jinja)
可信度
点赞93,tau2-bench telecom得分55%(原base 15%),3.5倍提升

社区实测

社区口碑分化:部分用户在 agentic coding 场景下体验良好,Q4/Q5 量化在消费级 GPU 上速度可用;但工具调用在不同框架下表现不稳定,Q8 量化速度明显下降。

  • agentic coding 任务表现良好,有用户称一次通过测试
  • 可在单张 RTX 3090 24G 或 4080 Super 16G 上运行
  • Q4/Q5 量化推理速度在消费级 GPU 上可用(50-72 t/s)
  • 开箱即用,配置简单
  • Q5 量化下仍有语法错误,一个文件需 23 次编辑修正
  • Q8 量化推理速度显著下降(约 25 t/s)
  • 在 OpenCode 等框架中工具调用失败,仅返回空回复
  • assistant 模型尚无 GGUF 量化版本,MTP 支持仍在开发中

截至 2026-06-21

快速上手示例

llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -m gemma4-v2-Q4_K_M.gguf --ctx-size 16384 --n-gpu-layers 99 --jinja

依赖版本和硬件参数请以源仓库说明为准。

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   3 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-06-20)

作者
yuxinlu1
任务类型
text-generation
推理库
gguf
下载
0
点赞
93
许可证
Apache-2.0
标签
gguf, gemma4, coding, agentic, terminal, tool-use, reasoning, thinking, llama.cpp, local-llm, text-generation, base_model:google/gemma-4-12B-it, base_model:quantized:google/gemma-4-12B-it, license:apache-2.0, endpoints_compatible, region:us, conversational

探索

源链接