此页是 2026-06-08 的观测快照,查看该模型当前信息 → /m/unsloth__gemma-4-26b-a4b-it-qat-gguf/

归档 / 2026-06-08 / Gemma-4-26B-A4B-QAT-GGUF (Unsloth)

Gemma-4-26B-A4B-QAT-GGUF (Unsloth)

Gemma 4 26B MoE 量化版,用于本地图像与文本推理

入选理由
Google Gemma 4 26B A4B 的 4bit QAT 量化版,MoE 激活仅 3.8B 参数,支持图像/文本输入和 256K 长上下文,GGUF 格式可直接用 llama.cpp/Ollama 运行,适合多模态推理和中文场景。
对位
替代 Gemma 3 27B,活跃参数仅 3.8B
适合
多模态文本/图像推理 / 256K 长上下文代码与代理
不适合
音频处理及低显存设备
规模
25.2B (3.8B active) · 256K
授权
Apache-2.0 (Gemma) · 可商用
框架
llama.cpp / ollama / unsloth
血统
量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized
可信度
下载 60k+,基于 Google 官方 QAT 检查点,Unsloth 动态量化

社区实测

QAT 版本大幅降低显存占用(约 72%),让 26B-A4B 可在 16GB 消费级 GPU 上本地运行且保持接近原始性能,Unsloth 的 GGUF 量化在 mean KL divergence 全部 22 个尺寸上排名第一。但编程场景默认参数下口碑两极分化,有用户报告大量低级错误,需降低 temperature 使用。

  • 显存占用降低约 72%,使 26B-A4B 可在 16GB 消费级 GPU 上本地运行
  • 推理速度比全精度快 40-60%,适合消费级/边缘部署
  • Unsloth GGUF 量化在全部 22 个模型尺寸的 mean KL divergence 上排名第一,达到 SOTA
  • 在接近原始性能的前提下实现约 3 倍内存节省
  • 支持文本+图像多模态输入
  • 可在 Unsloth Studio 中免费运行和训练
  • 提供 MTP assistant models 辅助推理加速
  • 支持 llama.cpp、vLLM、SGLang、Transformers 等多种推理框架
  • 编程任务在默认 temperature=1.0 下输出充满低级错误,需降至 0.3 或更低
  • 有用户称其为'最差的模型',在代码分析任务中给出大量错误建议
  • QAT 技术来自 Google,Unsloth 仅做格式转换,非独立改进
  • 非 QAT 版 Unsloth Q4_K_XL 中大量 tensor 使用了 q5/q6/q8 精度,可能影响量化一致性

截至 2026-06-21

快速上手

ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   3 / 5
总分
11

HuggingFace 原始数据 (抓取于 2026-06-08)

作者
unsloth
任务类型
image-text-to-text
推理库
transformers
下载
60,001
点赞
80
许可证
Apache-2.0 (Gemma)
标签
transformers, gguf, gemma4, image-text-to-text, unsloth, gemma, google, base_model:google/gemma-4-26B-A4B-it-qat-q4_0-unquantized, base_model:quantized:google/gemma-4-26B-A4B-it-qat-q4_0-unquantized, license:apache-2.0, endpoints_compatible, region:us, conversational

探索

源链接