Gemma-4-26B-A4B-QAT-GGUF (Unsloth)
Gemma 4 26B MoE 量化版,用于本地图像与文本推理
社区实测
QAT 版本大幅降低显存占用(约 72%),让 26B-A4B 可在 16GB 消费级 GPU 上本地运行且保持接近原始性能,Unsloth 的 GGUF 量化在 mean KL divergence 全部 22 个尺寸上排名第一。但编程场景默认参数下口碑两极分化,有用户报告大量低级错误,需降低 temperature 使用。
- 显存占用降低约 72%,使 26B-A4B 可在 16GB 消费级 GPU 上本地运行
- 推理速度比全精度快 40-60%,适合消费级/边缘部署
- Unsloth GGUF 量化在全部 22 个模型尺寸的 mean KL divergence 上排名第一,达到 SOTA
- 在接近原始性能的前提下实现约 3 倍内存节省
- 支持文本+图像多模态输入
- 可在 Unsloth Studio 中免费运行和训练
- 提供 MTP assistant models 辅助推理加速
- 支持 llama.cpp、vLLM、SGLang、Transformers 等多种推理框架
- 编程任务在默认 temperature=1.0 下输出充满低级错误,需降至 0.3 或更低
- 有用户称其为'最差的模型',在代码分析任务中给出大量错误建议
- QAT 技术来自 Google,Unsloth 仅做格式转换,非独立改进
- 非 QAT 版 Unsloth Q4_K_XL 中大量 tensor 使用了 q5/q6/q8 精度,可能影响量化一致性
Google releases new Gemma 4 QAT models! : r/unsloth - RedditGemma 4 QAT | Unsloth DocumentationGemma 4 QAT GGUFs from Unsloth : r/LocalLLaMA - Redditunsloth/gemma-4-26B-A4B-it-qat-GGUF · Hugging FaceQAT variant of Gemma4 26B A4B is not working well for me - RedditUnsloth Gemma 4 QAT MTP assistant models now available - RedditGemma-4-26B-A4B-it-UD-Q4_K_M.gguf : IMHO worst model ever ...Gemma 4 26b-a4b GGUF Performance Benchmarks : r/unslothWe benchmarked Gemma 4 26B-A4B GGUFs to identify the best ...Gemma 4 26B-A4B GGUFs: Unsloth Achieves SOTA on Mean KL ...gemma-4-26B-A4B-it-GGUF: Image-to-Text model - AIModels.fyi
截至 2026-06-21
快速上手
ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF