模型 / gemma-4-26B-A4B-it (Google)

gemma-4-26B-A4B-it (Google)

26B总参/4B活跃的MoE指令模型,面向本地推理

作者
lmstudio-community
对位
对位 Llama-3.1-8B、Qwen2.5-7B
适合
本地聊天与指令跟随 / 资源受限环境文本生成
不适合
高精度复杂推理
入选理由
GGUF量化版可直接本地运行;无新能力,仅格式转换。
规模
26B (4B活跃) · 128k · 最低 ~16GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 gemma-4-26B-A4B-it
国内访问
需代理
可信度
Hugging Face 下载量32.1万,社区点赞24,基于 Google 官方模型GGUF量化

社区实测

社区口碑两极分化严重:有人称之为「完美的全能本地模型」,也有人直指其为「最差模型」。共识在于它是同参数级别的异类——单次编码能力接近 GPT-5.2 和 Gemini 3 Pro,但工具调用和代理场景表现不稳定,默认温度下编码错误率高。性价比和推理速度是公认优势,适合作为轻量本地日常模型,但生产级编码需谨慎调参。

  • 本地推理速度快:RTX 4090 上达 138 tok/s,被描述为「本地试过最快的模型之一」
  • 单次编码(one-shot coding)能力接近 GPT-5.2 和 Gemini 3 Pro Preview 水平
  • 代理推理(agentic reasoning)在特定基准上超越 Sonnet 4.6 和 Gemini 3 Pro
  • 仅 3.8B 激活参数即可获得近 31B 质量,VRAM 占用约 15GB,消费级 GPU 可运行
  • Apache 2.0 许可,允许商用,无使用限制
  • 支持多模态输入(文本、图像、视频)
  • 256K 上下文窗口
  • API 定价低廉:$0.06/百万输入 token,$0.33/百万输出 token
  • 编码质量不稳定:默认温度下分析 JS 文件出现「大量愚蠢且琐碎的错误」,建议编码时温度降至 0.3 或更低
  • 工具调用/代理框架下表现退化:使用工具和自定义 harness 编写代码时表现明显差于单次编码
  • 4bit 量化版会遗漏工具调用并陷入参数猜测循环
  • KV 缓存压缩不如 Qwen3.5 和 Nemotron:fp16 下完整 260K 上下文需约 22GB VRAM 仅用于 KV 缓存
  • Google AI Studio 版本表现明显差于本地部署版本
  • 模型卡基准与实际体验存在落差:基准全面提升但实际混合表现可能不如前代
  • 部分评测机构将其编码和推理能力评为「有限」级别,编码能力「低于专业使用平均水平」

截至 2026-06-21

本形态 ~16GB 4-bit · 国内 需代理 · 321,432 下载

快速上手

llama-cli -m gemma-4-26B-A4B-it-Q4_K_M.gguf -p 你好

本形态源 ↗

下载动量

30天下载 66.8k → 53.1k · likes +3

观测时间线

模型家族

查看全部家族 →