模型 / gemma-4-26B-A4B-it (Google)

gemma-4-26B-A4B-it (Google)

26B总参/4B活跃的MoE指令模型,面向本地推理

作者 lmstudio-community

仓库标识lmstudio-community/gemma-4-26B-A4B-it-GGUF

显存未知许可 可商用最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
llama.cpp
下载
321,432

Hugging Face 源仓库 ↗

适合与不适合

入选理由
GGUF量化版可直接本地运行;无新能力,仅格式转换。
对位
对位 Llama-3.1-8B、Qwen2.5-7B
适合
本地聊天与指令跟随 / 资源受限环境文本生成
不适合
高精度复杂推理

独立证据与社区反馈

10 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

社区普遍认为 Gemma 4 26B A4B 是 Gemma 4 系列中调校最均衡的 MoE 变体,以约 4B 活跃参数的推理成本逼近 31B 密集模型的质量,在数学和编程上表现突出,但长上下文和 agentic 工具调用场景下可靠性明显下降,实际部署需 24GB+ 显存。

  • MoE 架构仅激活 4B 参数,在 RTX A6000 上实测达 9.58 tokens/s,比同硬件上的密集 31B 快约 18 倍
  • 数学推理能力突出,AIME 2026 达 88.3%,与 31B 的 89.2% 接近
  • 编程能力强,LiveCodeBench v6 77.1%、Codeforces ELO 1718,在同类开源模型中排名靠前
  • Arena AI 文本 ELO 1441,整体排名 #6,以约 8 倍更少的推理计算量获得 31B 97% 的质量
  • 支持 256K token 上下文窗口,可单次处理长篇文档
  • 支持文本+图像多模态输入,可处理截图、图表、文档等
  • 内置 Multi-Token Prediction 投机解码,推理加速且无损质量
  • Apache 2.0 许可证,无商用限制
  • 原生支持 function calling 和结构化 JSON 输出
  • 虽仅激活 4B 参数,但全部 26B 参数必须加载到显存,实际显存需求接近密集 26B 模型
  • 长上下文场景下性能严重退化,大输入和大输出任务会拖垮模型表现
  • Agentic 可靠性有限,DFO Agentic Index 仅 28.6,在 302 个模型中排 #139
  • 使用工具和自定义 harness 进行代码评估时表现反而不如一次性生成,工具调用和迭代优化能力弱
  • 不支持音频输入模态
  • 在 τ2-bench agentic 工具使用上,12B 模型(69.0%)略高于 26B A4B(68.2%)
  • 官方定位为高端桌面和服务器级部署,不适合 16GB 显存的机器

可信度Hugging Face 下载量32.1万,社区点赞24,基于 Google 官方模型GGUF量化

完整规格

规模
26B (4B活跃) · 128k · 权重格式未知,无法估算显存
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 gemma-4-26B-A4B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 56.3k → 50k · likes +1

观测时间线

模型家族

查看全部家族 →