模型 / Gemma-4-E2B-Heretic (DuoNeural)

Gemma-4-E2B-Heretic (DuoNeural)

Gemma 4 视觉模型 abliteration 版 GGUF 量化

作者 mradermacher

仓库标识mradermacher/Gemma-4-E2B-Heretic-i1-GGUF

显存未知许可 限制商用最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
llama.cpp
下载
1,990

Hugging Face 源仓库 ↗

适合与不适合

入选理由
Gemma-4 去审查版 GGUF 量化,Ollama/llama.cpp 可即用,适合本地运行无过滤文本生成。注意是多模态需另下 mmproj。
对位
对位原始 Gemma 4 视觉模型
适合
本地视觉问答推理 / 无审查内容生成实验
不适合
需要安全过滤的生产环境

独立证据与社区反馈

12 个独立来源最近验证 2026-08-09

社区整体把 Gemma 4 E2B 当低配设备上的高性价比日常主力:速度快、吃显存少(约 2B 权重即可跑满速,其余层留在 SSD 几乎不影响速度),老电脑与端侧都能跑;也因此 13 个去审查变体、9 位作者的 Heretic/abliterated 生态很热闹,DuoNeural 正是其中作者之一。口碑分歧主要在工具调用被 Qwen3.5 4B 比下去,以及去审查处理被不少人认为在许多场景反而损伤表现。

  • 只需约 2B 权重驻留显存即可跑满速,其余层留在 SSD 也几乎不影响速度,显存门槛极低
  • 在配置很差的电脑上也被认为是'真的不错'的小尺寸选项
  • 速度是核心卖点:笔记本级 RTX 5090 上 Q8 量化可超过 77 tokens/s
  • 原生会拒答的题目,经 ARA 矩阵优化压制后可以正常回答
  • Per-Layer Embeddings 等优化专为移动/边缘设备设计,适合手机、笔记本与本地应用
  • 支持 128K 上下文
  • 开源、免费,可完全本地部署
  • 同规格去审查变体多达 13 个、出自 9 位作者,选型空间大
  • Heretic/abliterated 处理在许多情况下会损伤表现,社区建议多数场景先靠提示词规避
  • 原生 E2B 会以'无法访问实时数据'为由拒绝回答某些问题,这是此类变体存在的原因
  • 工具调用可靠性被多用户吐槽,有人因此改用 Qwen3.5 4B
  • 比 E4B 更省内存,但 E4B 速度快不了多少却更可靠、能扛更多任务
  • 长上下文要拉满需降低量化或把层 offload 到系统内存,速度会明显下降
  • 有用户整体观感偏'懒',会直接拒答、不配合

可信度提供 imatrix 量化,涵盖 IQ1_S 至 Q6_K,Q4_K_M 仅 3.5GB

完整规格

规模
权重格式未知,无法估算显存
授权
gemma · 限制商用
框架
llama.cpp / ollama
血统
量化自 Gemma-4-E2B-Heretic
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 155 → 659

观测时间线