此页是 2026-06-11 的观测快照,查看该模型当前信息 → /m/mannix-ita__gemma-4-a4b-98e-v7-coderx-it-gguf/

归档 / 2026-06-11 / gemma-4-98e-coderx-GGUF (ManniX-ITA)

gemma-4-98e-coderx-GGUF (ManniX-ITA)

LCB-medium 99%,12GB 级代码专家量化包

入选理由
代码专用剪枝版Gemma4,在HumanEval+等代码任务上超越未剪枝版,可通过llama.cpp或ollama直接使用,适合单卡12GB以上。
对位
对位 Qwen2.5-Coder-14B 和 Qwen3.5-9B
适合
本地代码生成与评测 / 工具调用与多轮 agent
不适合
研究生级科学推理(GPQA 仅 48%)
规模
20.8B (A4B 活跃) · 未知
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 gemma-4-A4B-98e-v7-coderx-it
可信度
Q6_K 实测 HE+ 92.68%, LCB-100 99%, 下载 2.6 万

社区实测

Gemma 4 26B-A4B 在同参数级中编码能力突出、推理速度快且内存占用低,但作为 agent 时容易卡死或产生大量低级错误,社区口碑两极分化;ManniX-ITA 的 GGUF 量化版本降低了部署门槛,但对温度和量化等级敏感。

  • E4B 量化版仅需约 6GB RAM 即可运行,极大降低本地部署门槛
  • 26B-A4B 在 15GB VRAM 下可达 138 tok/s,速度约为 12B 的 1.7 倍
  • 多语言能力强,在德语、阿拉伯语、越南语、法语等非英语任务上优于 Qwen 3.5
  • E2B 有效参数 2.3B 的模型在多数 benchmark 上超过 Gemma 3 27B
  • 一次性编码问题得分接近 GPT 5.2 和 Gemini 3 Pro Preview
  • 对话和故事创作自然、有创造力,语言使用比 GPT-4 更自然
  • Apache 2.0 许可证消除了此前 Gemma 系列自定义许可证的使用限制顾虑
  • 12B QAT 量化版在创意写作场景表现最佳
  • 26B 是首个让用户在本地运行时感到'无怪异行为、直接好用'的模型
  • ManniX-ITA 提供从 IQ2_S(7.83GB) 到 Q6_K 的多档 GGUF 量化,Q3_K_M 为性价比最优档
  • 作为 coding agent 时在 Claude Code、Zed、OpenCode ACP 中均出现长时间卡死或超时
  • 高温度(1.0)下编码输出充满低级错误,需将 temperature 降至 0.3 或更低
  • 4-bit 量化版本会遗漏 tool use 调用并陷入错误参数循环
  • 使用工具和自定义 harness 写代码时表现反而比一次性生成更差
  • MoE 26B-A4B 推理速度明显慢于 Qwen 3.5 同级别 MoE 模型
  • 12B 模型开启 thinking mode 时 VRAM 不足,需关闭才能运行
  • 社区评价两极分化严重,有用户称其为'用过最差的模型'

截至 2026-06-21

快速上手

ollama pull mannix/gemma4-98e-v7-coderx:Q4_K_M

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   3 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-06-11)

作者
ManniX-ITA
任务类型
unknown
推理库
未指定
下载
26,511
点赞
0
许可证
apache-2.0
标签
gguf, imatrix, quantized, base_model:ManniX-ITA/gemma-4-A4B-98e-v7-coderx-it, base_model:quantized:ManniX-ITA/gemma-4-A4B-98e-v7-coderx-it, license:apache-2.0, endpoints_compatible, region:us, conversational

探索

源链接