gemma-4-E4B-it (Google)
Gemma4-4B-it 量化版, 本地轻量推理
社区实测
Gemma 4 E4B 在同尺寸模型中表现超出预期,4-bit GGUF 量化后仅需 6GB 显存即可流畅运行,网页搜索与代码执行等工具调用能力是突出亮点,指令遵循简洁不啰嗦;但滑动注意力机制在实际使用中存在问题,面对复杂任务时理解能力不及 GPT 5.4、kimi 2.5 等更大模型。
- 极低硬件门槛本地部署:4-bit GGUF 量化后仅需 6GB RAM 即可运行
- 网页搜索与代码执行的工具调用能力,可搜索并引用 10+ 网站
- 工具调用(tool calls)在更新后工作正常
- 复杂指令遵循能力强,输出简洁不啰嗦,比基准测试分数给人的预期更好
- 端侧/设备端部署,适合「私人故事记忆」等隐私场景
- 多模态支持:文本、图像输入,小模型原生支持音频
- Apache 2.0 许可,商用自由无限制
- 256K token 上下文窗口
- 首日即支持 Ollama、LM Studio、llama.cpp、Unsloth 等主流本地推理生态
- 滑动注意力(sliding attention)机制在实际工作中存在问题,影响长文本处理
- 复杂任务理解能力不如 GPT 5.4、kimi 2.5 等更大模型,需大量提示词调试
- 倾向于频繁自动触发网页搜索,即使并非必要
- Gemma 4 家族内部架构差异大(Dense vs MoE),不同尺寸模型能力特征不一致,选型需谨慎
来源
Gemma 4 E4B is amazing! The 4-bit GGUF can web-search, execute ...Gemma 4 - lazy model or am I crazy? (bit of a rant) : r/LocalLLaMAGemma 4 E4B - Am I missing something? : r/LocalLLM - RedditHonestly, Gemma 4 feels way better than the benchmarks say - Redditr/Gemma4 - Redditgoogle/gemma-4-E4B-it - Hugging FaceGemma 4: Byte for byte, the most capable open models - Google BlogGemma 4 by Google: Specs, Benchmarks, and How to Run It Locally ...Google Gemma 4 Developer Guide: Benchmarks & Local ...Google's Gemma 4 is Weirder than you Realize - Devansh
截至 2026-06-21