模型 / Grok-3-reasoning-gemma3-4B-GGUF (mradermacher)

Grok-3-reasoning-gemma3-4B-GGUF (mradermacher)

Grok-3推理蒸馏Gemma3-4B的GGUF量化版

作者 mradermacher

仓库标识mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF

~2.4GB 4-bit许可 可商用任务 文本生成最近核对 2026-08-05
格式
4-bit
文件
~2.1GB
运行内存
~2.4GB–3.1GB
运行时
OLLAMA
下载
585

Hugging Face 源仓库 ↗

快速上手示例

ollama run hf.co/mradermacher/Grok-3-reasoning-gemma3-4B-distilled-HF-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
提供现成GGUF,可直接用llama.cpp/Ollama本地运行Gemma3蒸馏版,适合快速体验推理风格。
对位
对位 Gemma-3-4B
适合
本地轻量推理部署 / 实验蒸馏推理能力
不适合
高精度生产任务

独立证据与社区反馈

5 个独立来源 · 另 2 官方/转载最近验证 2026-08-05

一款 4B 蒸馏 GGUF 模型,体积小巧可在单 GPU/消费级硬件上运行,提供从 Q2_K 到 f16 的多种量化选择;作为 4B 量级速度不错,但推理能力与顶级闭源模型仍有差距,实际表现参差不齐。

  • 4B 参数规模可在单 GPU 上运行,降低部署门槛和成本
  • 提供从 Q2_K(1.8GB) 到 f16(7.9GB) 多种量化规格,适配不同硬件条件
  • Q4_K_S 和 Q4_K_M 量化被标注为 fast, recommended,适合日常使用
  • 支持 llama.cpp、Ollama、Transformers、Docker、Unsloth Studio 等多种部署方式
  • 作为 4B 模型推理速度快
  • Gemma 许可证下开放权重,可自托管或微调
  • 实际表现参差不齐,仍落后于 OpenAI 的最优模型
  • 暂无加权/imatrix 量化版本可用
  • Q3_K_M 量化被标注为 lower quality
  • f16 量化体积 7.9GB,对 4B 模型而言被标注为 overkill
  • Gemma 3 4B 基座在 GPQA Diamond(30.8)和 MMLU Pro(40.5)等推理基准上得分较低

可信度由mradermacher量化,提供Q2_K至f16共11种量化级别

完整规格

规模
4B · 下载 ~2.1GB · 显存最低 ~2.4GB · 推荐 ~3.1GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 Grok-3-reasoning-gemma3-4B-distilled-HF
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1.2k → 1.2k

观测时间线