模型 / Gemma-4-E4B-it-QAT (Google)

Gemma-4-E4B-it-QAT (Google)

Google Gemma 4 量化版,本地消费级硬件推理

作者
lmstudio-community
对位
对位 Qwen2.5-4B 或 Phi-3-mini
适合
本地聊天助手 / 边缘设备文本生成
不适合
高吞吐生产环境(仅4B)
入选理由
Google Gemma-4指令模型的QAT量化版GGUF,可在本地LM Studio等快速部署,适合本地推理,但非新模型。
规模
4B · 最低 ~2.4GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
llama.cpp / LM Studio
血统
量化自 gemma-4-E4B-it-qat-q4_0-unquantized
国内访问
需代理
可信度
由 LM Studio 团队从 Google 官方 Gemma 4 QAT 模型量化,Apache-2.0 许可

社区实测

社区普遍认为 Gemma 4 E4B QAT 是同尺寸中最强的小模型之一,QAT 让 4-bit 量化后质量损失极小,仅需 6GB 显存即可跑 agentic 工作流。指令遵循能力超出基准预期,但复杂推理任务上仍不及 GPT-5.4 等大模型,且部分用户日常更偏好 Qwen 3.6。

  • 仅需 6GB 内存即可运行 agentic 工作流(网页搜索、代码执行)
  • QAT 在 4-bit 量化下保持模型质量
  • 指令遵循能力优于基准测试所暗示的水平
  • Apache 2.0 许可证支持商用
  • 首发即支持 Ollama、LM Studio、llama.cpp、Unsloth 等主流工具
  • 支持 256K 上下文窗口
  • 原生函数调用支持
  • 可在 6-8GB VRAM 的笔记本上运行
  • 复杂任务上不如 GPT 5.4、kimi 2.5 等更大模型
  • 部分用户在日常使用中更偏好 Qwen 3.6
  • 选错 Gemma 4 变体会导致体验很差
  • 实际运行速度可能低于基准测试数据

截至 2026-06-21

本形态 ~2.4GB 4-bit · 国内 需代理 · 419 下载

快速上手

llama.cpp -m gemma-4-E4B-it-QAT.gguf

本形态源 ↗

下载动量

30天下载 9.1k → 7.8k · likes +2

观测时间线