模型 / Gemma4-26B-A4B (HauhauCS)

Gemma4-26B-A4B (HauhauCS)

无审查Gemma4-26B MoE,适用于代理编码与创意写作

作者
HauhauCS
对位
激活4B,与Phi-3-mini(3.8B)同级
适合
代理编码与工具调用 / 多模态角色扮演/故事创作
不适合
需要严格内容过滤的生产环境
入选理由
解禁版Gemma4 GGUF,附带MTP投机解码提速35%,支持视觉输入,推荐llama.cpp加载,适合无审查多模态和编程用户。
规模
26B-A4B · 256k · 最低 ~16GB · 4-bit(估算)
授权
gemma · 需自查
框架
llama.cpp / LM Studio / koboldcpp
国内访问
需代理
可信度
35k下载,0/465拒答测试,附带GGUF与MTP投机解码加速

社区实测

Gemma4 26B-A4B 被社区广泛认可为一款本地部署速度快、性价比突出的 MoE 模型,仅约 3.8B 激活参数即可在单次编码任务上与 GPT-5.2/Gemini 3 Pro 等大模型对标,非常适合消费级硬件本地运行。HauhauCS 的去审查版本在创意写作和角色扮演场景中几乎无拒答,被视为 99%+ 用户的推荐默认选择,但在工具调用和 agent 编码任务上表现有所回落,综合编码能力不及同期的 Qwen3.6-35B-A3B。

  • 本地推理速度快,仅约 4B 激活参数即可流畅运行,适合消费级硬件部署
  • 在同一 Gemma 4 系列中 26B-A4B 胜出所有场景且推理速度约为可比模型的 1.7 倍
  • 在难度高、难以刷分的单次编码基准上与 GPT-5.2 和 Gemini 3 Pro Preview 得分相当
  • HauhauCS 去审查版本在 NSFW 场景中输出完整、无保留,适合创意写作与角色扮演
  • API 层面有多家提供商,最低可免费使用(Google AI Studio),推理成本可低至 $0.10/1M tokens
  • 具备多模态能力,在小显存(如 16GB)场景下比同代 MoE 竞品更有优势
  • 文件体积较小(Q6 约 23.3GB),对边缘设备和有限 VRAM 环境更友好
  • 在工具调用/自定义 harness 编码评测中表现显著弱于其单次编码成绩,实际 agent 场景可靠性存疑
  • HauhauCS 作者在社区中拒绝与用户讨论和对话,引发部分用户不满
  • 去审查版本有时需要先「说服自己」才能输出,并非所有场景都立即响应
  • HauhauCS 的 31B 版本已宣布但尚未发布,目前仅有 26B 和更小的 E4B/E2B 可用
  • 不同 API 提供商之间性能差异巨大,TTFT 从 0.68s 到 5.51s 不等,输出速度相差近 5 倍
  • 在编码/agent 任务上明显落后于 Qwen3.6-35B-A3B(Terminal-Bench 2.0 差距 +8.6 分)
  • 社区有反馈称其实际表现与模型卡上的全面提升描述存在落差,有时甚至弱于前代

截至 2026-07-05

本形态 ~16GB 4-bit · 国内 需代理 · 35,164 下载

快速上手

llama-server -m Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-Q4_K_M.gguf --mmproj mmproj-Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-BF16.gguf -md mtp-gemma-4-26B-A4B-it.gguf --spec-type draft-mtp -ngl 99 -fa on (需下载3个文件)

本形态源 ↗

下载动量

30天下载 97.2k → 117.6k

观测时间线