模型 / Gemma-4-26B-A4B-QAT-GGUF (Unsloth)

Gemma-4-26B-A4B-QAT-GGUF (Unsloth)

Gemma 4 26B MoE 量化版,用于本地图像与文本推理

作者
unsloth
对位
替代 Gemma 3 27B,活跃参数仅 3.8B
适合
多模态文本/图像推理 / 256K 长上下文代码与代理
不适合
音频处理及低显存设备
入选理由
Google Gemma 4 26B A4B 的 4bit QAT 量化版,MoE 激活仅 3.8B 参数,支持图像/文本输入和 256K 长上下文,GGUF 格式可直接用 llama.cpp/Ollama 运行,适合多模态推理和中文场景。
规模
25.2B (3.8B active) · 256K · 最低 ~15GB · 4-bit(估算)
授权
Apache-2.0 (Gemma) · 可商用
框架
llama.cpp / ollama / unsloth
血统
量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized
国内访问
需代理
可信度
下载 60k+,基于 Google 官方 QAT 检查点,Unsloth 动态量化

社区实测

QAT 版本大幅降低显存占用(约 72%),让 26B-A4B 可在 16GB 消费级 GPU 上本地运行且保持接近原始性能,Unsloth 的 GGUF 量化在 mean KL divergence 全部 22 个尺寸上排名第一。但编程场景默认参数下口碑两极分化,有用户报告大量低级错误,需降低 temperature 使用。

  • 显存占用降低约 72%,使 26B-A4B 可在 16GB 消费级 GPU 上本地运行
  • 推理速度比全精度快 40-60%,适合消费级/边缘部署
  • Unsloth GGUF 量化在全部 22 个模型尺寸的 mean KL divergence 上排名第一,达到 SOTA
  • 在接近原始性能的前提下实现约 3 倍内存节省
  • 支持文本+图像多模态输入
  • 可在 Unsloth Studio 中免费运行和训练
  • 提供 MTP assistant models 辅助推理加速
  • 支持 llama.cpp、vLLM、SGLang、Transformers 等多种推理框架
  • 编程任务在默认 temperature=1.0 下输出充满低级错误,需降至 0.3 或更低
  • 有用户称其为'最差的模型',在代码分析任务中给出大量错误建议
  • QAT 技术来自 Google,Unsloth 仅做格式转换,非独立改进
  • 非 QAT 版 Unsloth Q4_K_XL 中大量 tensor 使用了 q5/q6/q8 精度,可能影响量化一致性

截至 2026-06-21

本形态 ~15GB 4-bit · 国内 需代理 · 60,001 下载

快速上手

ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF

本形态源 ↗

下载动量

30天下载 726.3k → 498.9k · likes +115

观测时间线