SummFlow 2026-06-11 Hugging Face

Gemma-4-31B-it (Google)

31B 多模态模型,支持图像输入,GGUF 量化版

入选理由
Gemma 4 31B Q4_0 GGUF量化版,多模态(图像+文本),256K上下文,推理能力强大,显存需求低,Ollama/llama.cpp即下即用。
对位
对标 Llama 4 Scout 34B / Qwen2.5-VL-32B
适合
复杂推理与编程(AIME 89.2%) / 多模态文档解析与 Agent 工具调用
不适合
纯音频任务(31B 不支持音频输入)
规模
31B · 256K
授权
Apache-2.0 · 可商用
框架
llama.cpp / ollama
血统
量化自 gemma-4-31B-it-qat-q4_0-unquantized
可信度
HF 4.5万下载,MMLU Pro 85.2%,AIME 2026 89.2%,Google 开源

社区实测

Gemma 4 31B 以 31B 参数量在多项社区基准中击败了 GPT-5.2、Sonnet 4.6 等大得多的闭源模型,尤其在 agentic reasoning 和长程任务规划上表现突出,被普遍视为开源模型效率的里程碑;日常编码、指令遵循和对话体验也获得大量好评,但滑动注意力机制和推理速度仍是实际使用中的短板。

  • 以极低成本实现接近顶级闭源模型的 agentic reasoning 能力
  • 长程任务规划中能遵循自身建议、不掉链子
  • 复杂指令遵循精准,输出不啰嗦、不废话
  • 编码和日常任务表现扎实
  • 对话和故事叙述自然、有创造力
  • 26B 版本内存占用小、速度快,适合本地部署
  • 支持多模态输入(视觉),26B 版本即具备视觉能力
  • 性价比极高,单次运行成本远低于 GPT-5.2、Sonnet 4.6 等闭源模型
  • 滑动注意力机制在实际工作中存在问题
  • dense 模型质量虽高但推理速度明显慢于 MoE 方案
  • 社区基准排名存在分歧,部分用户认为 Qwen 表现相当或更好
  • 早期测试中存在影响性能的 bug,修复后基准才恢复正常

截至 2026-06-21

快速上手

huggingface_hub download google/gemma-4-31B-it-qat-q4_0-gguf