此页是 2026-05-21 的观测快照,查看该模型当前信息 → /m/lmstudio-community__gemma-4-26b-a4b-it-gguf/

归档 / 2026-05-21 / gemma-4-26B-A4B-it (Google)

gemma-4-26B-A4B-it (Google)

26B总参/4B活跃的MoE指令模型,面向本地推理

入选理由
GGUF量化版可直接本地运行;无新能力,仅格式转换。
对位
对位 Llama-3.1-8B、Qwen2.5-7B
适合
本地聊天与指令跟随 / 资源受限环境文本生成
不适合
高精度复杂推理
规模
26B (4B活跃) · 128k
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 gemma-4-26B-A4B-it
可信度
Hugging Face 下载量32.1万,社区点赞24,基于 Google 官方模型GGUF量化

社区实测

社区口碑两极分化严重:有人称之为「完美的全能本地模型」,也有人直指其为「最差模型」。共识在于它是同参数级别的异类——单次编码能力接近 GPT-5.2 和 Gemini 3 Pro,但工具调用和代理场景表现不稳定,默认温度下编码错误率高。性价比和推理速度是公认优势,适合作为轻量本地日常模型,但生产级编码需谨慎调参。

  • 本地推理速度快:RTX 4090 上达 138 tok/s,被描述为「本地试过最快的模型之一」
  • 单次编码(one-shot coding)能力接近 GPT-5.2 和 Gemini 3 Pro Preview 水平
  • 代理推理(agentic reasoning)在特定基准上超越 Sonnet 4.6 和 Gemini 3 Pro
  • 仅 3.8B 激活参数即可获得近 31B 质量,VRAM 占用约 15GB,消费级 GPU 可运行
  • Apache 2.0 许可,允许商用,无使用限制
  • 支持多模态输入(文本、图像、视频)
  • 256K 上下文窗口
  • API 定价低廉:$0.06/百万输入 token,$0.33/百万输出 token
  • 编码质量不稳定:默认温度下分析 JS 文件出现「大量愚蠢且琐碎的错误」,建议编码时温度降至 0.3 或更低
  • 工具调用/代理框架下表现退化:使用工具和自定义 harness 编写代码时表现明显差于单次编码
  • 4bit 量化版会遗漏工具调用并陷入参数猜测循环
  • KV 缓存压缩不如 Qwen3.5 和 Nemotron:fp16 下完整 260K 上下文需约 22GB VRAM 仅用于 KV 缓存
  • Google AI Studio 版本表现明显差于本地部署版本
  • 模型卡基准与实际体验存在落差:基准全面提升但实际混合表现可能不如前代
  • 部分评测机构将其编码和推理能力评为「有限」级别,编码能力「低于专业使用平均水平」

截至 2026-06-21

快速上手

llama-cli -m gemma-4-26B-A4B-it-Q4_K_M.gguf -p 你好

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   1 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-05-21)

作者
lmstudio-community
任务类型
unknown
推理库
未指定
下载
321,432
点赞
24
许可证
Apache-2.0
标签
gguf, base_model:google/gemma-4-26B-A4B-it, base_model:quantized:google/gemma-4-26B-A4B-it, license:apache-2.0, endpoints_compatible, region:us, conversational

探索

源链接