模型 / Gemma-4-E4B-it-QAT (Google)

Gemma-4-E4B-it-QAT (Google)

Google Gemma 4 量化版,本地消费级硬件推理

作者 lmstudio-community

仓库标识lmstudio-community/gemma-4-E4B-it-QAT-GGUF

显存未知许可 可商用最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
llama.cpp
下载
419

Hugging Face 源仓库 ↗

适合与不适合

入选理由
Google Gemma-4指令模型的QAT量化版GGUF,可在本地LM Studio等快速部署,适合本地推理,但非新模型。
对位
对位 Qwen2.5-4B 或 Phi-3-mini
适合
本地聊天助手 / 边缘设备文本生成
不适合
高吞吐生产环境(仅4B)

独立证据与社区反馈

5 个独立来源 · 另 3 官方/转载最近验证 2026-08-05

Gemma 4 E4B 是一款 4.5B 参数的多模态边缘模型,256K 上下文、140+ 语言支持,8GB RAM 中端设备即可运行,QAT 版本进一步压缩内存至约 6.7GB 且精度优于标准 PTQ。日常对话与多语言表现扎实,但数学推理和编程能力明显弱于同系列大尺寸模型,手机 TPU 兼容性不足,运行速度也慢于 Qwen 3.5。

  • 8GB RAM 中端设备即可运行,面向日常使用场景 (Towards AI 实测)
  • 支持文本、图像、音频多模态输入
  • 256K token 长上下文窗口
  • 支持 140+ 种语言的多语言能力
  • QAT 版本内存需求降至约 6.7GB,且准确率优于标准 PTQ
  • 可在手机、树莓派、NVIDIA Jetson Orin Nano 等边缘设备离线运行,延迟极低
  • 相比 Gemma 3 系列,安全对齐显著提升,不当拒绝率低
  • 德语、阿拉伯语、越南语等非英语任务表现优于 Qwen 3.5
  • 数学推理偏弱,AIME 2026 仅 42.5%
  • 编程能力有限,Codeforces ELO 仅 940,LiveCodeBench v6 仅 52.0%
  • E4B 模型在手机 TPU 上放不下,会自动回退到 RAM 运行
  • 运行速度显著慢于 Qwen 3.5
  • GPQA Diamond 仅 58.6%,研究生级科学推理能力不足
  • 采用滑动窗口+全局注意力交替架构,部分长程推理模式可能受限

可信度由 LM Studio 团队从 Google 官方 Gemma 4 QAT 模型量化,Apache-2.0 许可

完整规格

规模
4B · 权重格式未知,无法估算显存
授权
Apache-2.0 · 可商用
框架
llama.cpp / LM Studio
血统
量化自 gemma-4-E4B-it-qat-q4_0-unquantized
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 7.5k → 4.4k

观测时间线