模型 / Gemma-4-12B Agentic v2 (yuxinlu1)

Gemma-4-12B Agentic v2 (yuxinlu1)

编程与工具调用代理微调,供开发者本地使用

作者 yuxinlu1

仓库标识yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2

显存未知许可 可商用任务 智能体最近核对 2026-08-23

仅 safetensors · 无 pickle 加载风险

运行内存
权重格式未知,无法估算显存
运行时
LLAMA-SERVER
下载
1,833

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF -ngl 99 --jinja

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
专为编码与终端代理微调的Gemma4-12B,tau2-bench工具使用能力提升3.5倍,提供GGUF量化可在8GB显存运行,适合本地开发辅助。
对位
对位 Qwen2.5-14B / Llama-3-8B
适合
终端多步工具调用与调试 / 本地程序合成与测试
不适合
通用知识问答与事实查询

独立证据与社区反馈

7 个独立来源 · 另 1 官方/转载最近验证 2026-08-23

社区对 Gemma 4 12B 的整体口碑是「小尺寸里的高性价比」:速度快、质量很接近但略低于 27B/31B,同尺寸里相当能打。编程与 agent 场景看法两极——有人认为同显存下比 27B@Q2 更难找到更好的编程/agent 选择,也有人觉得纯技术问答、写码和 agent 活儿 Qwen 更稳,Gemma 的强项在创意写作与聊天。部署门槛低,Q4 量化约 8GB 显存、16GB 笔记本即可本地跑,但配置不对会明显拉胯,多模态/语音在长上下文下还容易翻车。

  • 消费级硬件可跑:Q4 量化约 8GB 显存、16GB 笔记本即可本地运行,且原生多模态(文本/图像/音频/视频)无需额外 mmpro 组件
  • 速度与体积比出色:社区称「对这个尺寸来说快得离谱、质量也高」,整体接近但略低于更大的 27B/31B
  • 低显存下的编程/agent 替代:有人认为同 VRAM 需求下很难找到比它更好的编程/agent 选择,量化 Q2 及以上都可用
  • 创意写作与聊天口碑好:社区总体认为 Gemma 在创意写作和闲聊上强于 Qwen
  • agent 工作流可配 vLLM 提速:vLLM 的 prefill 速度约比 llama.cpp 高 4 倍,agent 使用的体感差异明显
  • 通用知识表现可圈可点:MMLU Pro 上超过上一年的 27B
  • 面向本卡(v2 微调):在 tau2-bench 这类真实终端式「诊断→修复→验证」的 agentic 工具调用基准上成绩突出
  • 生成代码偶有低级语法错误:会多打括号/括号不配对、用逗号分隔函数定义,需手工修正
  • 低量化有损:Q4 以下质量明显下滑(serious degradation),用低量化需有预期
  • 多模态语音在长上下文(约 4k-8k)下会不回指令/失效,纯文本模式才正常,agent 场景建议纯文本
  • 本地设置容易搞坏体验:社区普遍反馈「卡是好卡,但你的本地配置可能在毁它」
  • 技术向口碑有分歧:不少用户仍认为纯问答、写码、agent 类活儿 Qwen 更稳
  • 工具调用与 agentic 需要调参:社区常在求教开启 tool calling 与 agentic 的参数与思路,默认配置不一定好用
  • v2 微调偏科:通用知识(MMLU-Pro)比基础卡略低,是聚焦 coding+agentic 的取舍
  • 综合榜单排名一般:综合榜 218 款里排第 147,公开分 47.32/100(标注为估算,仅 12 行基准)

可信度tau2-bench telecom 55% vs base 15%,48 likes,GGUF 一键部署

完整规格

规模
12B · 16k(示例命令) · 权重格式未知,无法估算显存
授权
Apache-2.0 · 可商用
框架
transformers / llama.cpp / ollama
工具调用
Gemma 4 原生工具调用
血统
微调自 gemma-4-12B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 3.7k → 1.1k · likes +7

观测时间线

模型家族

查看全部家族 →