SummFlow 2026-06-07 Hugging Face

Gemma-4-26B-A4B (Google)

量化 Gemma-4,本地运行对话与指令

入选理由
Gemma 4的4bit量化版,可直接用LM Studio或Ollama本地运行,适合私密部署和中低显存用户。
对位
对位 Llama-3.1-8B / Qwen2.5-7B
适合
本地资源受限的对话系统 / 需要快速响应的指令任务
不适合
复杂多步推理与专业知识
规模
26B (4B active) · 未知
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 gemma-4-26B-A4B-it-qat-q4_0-unquantized
可信度
HuggingFace 下载 8.3k,Google 发布,Apache-2.0,llama.cpp 兼容

社区实测

Gemma 4 26B-A4B 是速度与质量平衡出色的 MoE 本地模型,仅 3.8B 激活参数即实现接近 31B 稠密模型的性能,在一次性编程任务上可媲美 GPT-5.2 级别模型,但工具调用和 agent 场景可靠性不足,综合口碑两极分化。Apache 2.0 协议和低 VRAM 门槛使其成为消费级硬件上最具吸引力的开源选项之一,但在编程基准上仍落后于同期的 Qwen MoE 竞品。

  • 本地推理速度极快,RTX 4090 上可达 138 tok/s,M4 Pro 48GB 上 73.2 tok/s
  • 一次性编程任务表现突出,在特定基准上得分接近 GPT-5.2 和 Gemini 3 Pro Preview
  • MoE 架构仅 3.8B 激活参数,VRAM 占用约 15GB,消费级显卡可运行
  • Apache 2.0 许可证,允许无限制商用
  • 多语言质量扎实,在德语、阿拉伯语、越南语、法语等非英语任务上优于 Qwen 3.5
  • 具备多模态能力(文本+图像输入),Q6 量化文件仅 23.3GB,比竞品更小
  • 适合 16GB VRAM 设备,是该显存档位下的优选
  • 256K 上下文窗口,支持超长文本处理
  • 工具调用和 agent 编程不可靠,容易陷入循环猜测参数
  • 默认温度下编程质量下降明显,编程任务需将 temperature 降至 0.3 或更低
  • MoE 推理速度显著慢于 Qwen 3.5 的 MoE 等价模型
  • 编程/Agent 基准落后于 Qwen3.6 35B A3B(Terminal-Bench 2.0: 42.9 vs 51.5)
  • 偶有「懒惰」回应,坚称只有 Google 才能托管如此强大的模型
  • 模型卡基准表现好但实际使用体验参差不齐,存在基准与实际表现脱节的问题

截至 2026-06-21

快速上手

llama.cpp: ./main -m gemma-4-26B-A4B-it-QAT.gguf -p 'prompt'