模型 / gemma-4-E4B-it (Google)

gemma-4-E4B-it (Google)

Gemma4-4B-it 量化版, 本地轻量推理

作者
lmstudio-community
对位
对位 Llama-3.2-3B、Phi-3-mini
适合
本地轻量指令跟随与聊天 / 消费级 GPU/CPU 推理
不适合
复杂推理与多语言长文本
入选理由
GGUF格式可直接运行;下载量超百万;量化版本无新能力
规模
4B · 最低 ~2.4GB · 4-bit(估算)
授权
apache-2.0 · 可商用
框架
llama.cpp / LM Studio
血统
量化自 gemma-4-E4B-it
国内访问
需代理
可信度
下载 122 万, Google 官方权重, llama.cpp 量化

社区实测

Gemma 4 E4B 在同尺寸模型中表现超出预期,4-bit GGUF 量化后仅需 6GB 显存即可流畅运行,网页搜索与代码执行等工具调用能力是突出亮点,指令遵循简洁不啰嗦;但滑动注意力机制在实际使用中存在问题,面对复杂任务时理解能力不及 GPT 5.4、kimi 2.5 等更大模型。

  • 极低硬件门槛本地部署:4-bit GGUF 量化后仅需 6GB RAM 即可运行
  • 网页搜索与代码执行的工具调用能力,可搜索并引用 10+ 网站
  • 工具调用(tool calls)在更新后工作正常
  • 复杂指令遵循能力强,输出简洁不啰嗦,比基准测试分数给人的预期更好
  • 端侧/设备端部署,适合「私人故事记忆」等隐私场景
  • 多模态支持:文本、图像输入,小模型原生支持音频
  • Apache 2.0 许可,商用自由无限制
  • 256K token 上下文窗口
  • 首日即支持 Ollama、LM Studio、llama.cpp、Unsloth 等主流本地推理生态
  • 滑动注意力(sliding attention)机制在实际工作中存在问题,影响长文本处理
  • 复杂任务理解能力不如 GPT 5.4、kimi 2.5 等更大模型,需大量提示词调试
  • 倾向于频繁自动触发网页搜索,即使并非必要
  • Gemma 4 家族内部架构差异大(Dense vs MoE),不同尺寸模型能力特征不一致,选型需谨慎

截至 2026-06-21

本形态 ~2.4GB 4-bit · 国内 需代理 · 1,229,116 下载

本形态源 ↗

下载动量

30天下载 816k → 750.1k · likes +8

观测时间线

模型家族

查看全部家族 →