Gemma-4-26B-A4B (Google)
量化 Gemma-4,本地运行对话与指令
社区实测
Gemma 4 26B-A4B 是速度与质量平衡出色的 MoE 本地模型,仅 3.8B 激活参数即实现接近 31B 稠密模型的性能,在一次性编程任务上可媲美 GPT-5.2 级别模型,但工具调用和 agent 场景可靠性不足,综合口碑两极分化。Apache 2.0 协议和低 VRAM 门槛使其成为消费级硬件上最具吸引力的开源选项之一,但在编程基准上仍落后于同期的 Qwen MoE 竞品。
- 本地推理速度极快,RTX 4090 上可达 138 tok/s,M4 Pro 48GB 上 73.2 tok/s
- 一次性编程任务表现突出,在特定基准上得分接近 GPT-5.2 和 Gemini 3 Pro Preview
- MoE 架构仅 3.8B 激活参数,VRAM 占用约 15GB,消费级显卡可运行
- Apache 2.0 许可证,允许无限制商用
- 多语言质量扎实,在德语、阿拉伯语、越南语、法语等非英语任务上优于 Qwen 3.5
- 具备多模态能力(文本+图像输入),Q6 量化文件仅 23.3GB,比竞品更小
- 适合 16GB VRAM 设备,是该显存档位下的优选
- 256K 上下文窗口,支持超长文本处理
- 工具调用和 agent 编程不可靠,容易陷入循环猜测参数
- 默认温度下编程质量下降明显,编程任务需将 temperature 降至 0.3 或更低
- MoE 推理速度显著慢于 Qwen 3.5 的 MoE 等价模型
- 编程/Agent 基准落后于 Qwen3.6 35B A3B(Terminal-Bench 2.0: 42.9 vs 51.5)
- 偶有「懒惰」回应,坚称只有 Google 才能托管如此强大的模型
- 模型卡基准表现好但实际使用体验参差不齐,存在基准与实际表现脱节的问题
New Google Gemma 4 12B Claims Near-26B Performance - RedditI ran Gemma 4 as a local model in Codex CLI - Hacker NewsGemma-4-26B-A4B-it-UD-Q4_K_M.gguf : IMHO worst model ever ...Gemma 4 26b is the perfect all around local model and I'm surprised ...Gemma 4 - lazy model or am I crazy? (bit of a rant) : r/LocalLLaMAGemma 4 After 24 Hours: What the Community Found vs What ...Gemma 4 26B A4B (free) - API Pricing & Benchmarks | OpenRouterGemma 4 26B-A4B Benchmarks, Pricing & Context WindowGemma 4 26B really is an outlier in its weight class. In our little ...Can I really code on my PC? Gemma4 26B A4B vs Qwen3.6 ...google/gemma-4-26B-A4B-it - Hugging Face
截至 2026-06-21
快速上手
llama.cpp: ./main -m gemma-4-26B-A4B-it-QAT.gguf -p 'prompt'