模型 / Gemma4-12B-Coder (yuxinlu1)

Gemma4-12B-Coder (yuxinlu1)

本地 Python 编程模型,离线解决算法问题

作者
yuxinlu1
对位
对位 CodeLlama-13B/StarCoder2-15B
适合
Python 算法题解答 / 本地离线编程助手
不适合
非 Python 任务和安全对话
入选理由
Gemma-4 12B 的编码微调版,提供 4.5~12GB 的 GGUF 量化,本地离线可用,适合 Python 算法题推理。
规模
12B · 131k · 最低 ~7.2GB · 4-bit(估算)
授权
gemma · 可商用
框架
llama.cpp / ollama / lm-studio
血统
量化自 gemma-4-12B-it
国内访问
需代理
可信度
HuggingFace 2,433 下载,60 点赞;训练数据为验证通过的 Python 代码

社区实测

社区评价两极分化:部分用户认为 Gemma 4 12B 在 12B 级别本地编程表现亮眼,Q5 量化下可一键完成不少编码任务且部署即插即用;但另一些用户指出其在 OpenCode 等工具调用场景下几乎不可用,严肃编程仍倾向更大的模型。

  • 完全离线在笔记本上运行高阶推理(evidence 0)
  • Pi harness 下即插即用,设置缓存和上下文长度后即可开始编程(evidence 3)
  • Q5_K_XL 量化下多数编码任务可一次通过(one-shotted),Q4 下速度约 61 t/s(evidence 3)
  • 可连续生成 4372 token、467 行代码的完整游戏,单次流式输出约 4 分钟(evidence 6)
  • 适合 Lua 脚本编写(如 Cyberpunk 2077 mod)(evidence 3)
  • 原生多模态:文本、图像、音频、视频(evidence 11)
  • Apache 2.0 完全宽松许可(evidence 11)
  • 部署方式丰富:llama.cpp、Ollama、Pi、Unsloth Studio、Hermes Agent 等(evidence 9)
  • 体积小,可在消费级硬件上运行(evidence 12)
  • OpenCode 下工具调用极差,Q8 量化连一次工具调用都无法完成,只回复"Okay."(evidence 4、7)
  • 工具调用时反复无法正确指定参数(如 grep 的 pattern),调用被拒绝(evidence 7)
  • 有用户明确表示不会用它做编程调试,倾向 Gemma-4-31B 或 Qwen3.6-27B(evidence 1)
  • 该 Fable-5 微调被质疑为噱头,认为 12B 模型无法承载更大模型的推理能力(evidence 2)
  • 官方 8Q 模型存在拒答问题,需 heretic 版本才能正常生成(evidence 6)
  • Q8 量化生成速度骤降至 25.2 t/s,相比 Q4 的 72.3 t/s 大幅下降(evidence 5)
  • 尚无 assistant 模型的 GGUF 量化版本(evidence 5)
  • MTP(多 token 预测)支持仍在开发中(evidence 5)

截至 2026-06-21

本形态 ~7.2GB 4-bit · 国内 需代理 · 2,433 下载

快速上手

ollama run hf.co/yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF

本形态源 ↗

下载动量

30天下载 729.4k → 399.2k · likes +573

观测时间线

模型家族

查看全部家族 →