SummFlow 2026-06-26 Hugging Face

Gemma-4-31B-it (Google)

IQ2_M 31B 多模态 Agent,10 GiB 本地运行

入选理由
Ollama 一行命令即可运行 Gemma 4 31B 多模态模型,10GB 级别显存即可本地部署,支持图像理解和代码生成,适合个人开发者快速试用。
对位
对位 Qwen2.5-32B、Yi-34B 同级量化
适合
本地多模态 Agent 推理 / 代码与工具调用任务
不适合
高精度语言生成
规模
31B · 未知
授权
gemma · 需自查
框架
llama.cpp / ollama / lm-studio
血统
量化自 gemma-4-31B-it
可信度
下载 12k,SWE-rebench IQ4_XS 47% pass,IQ2_M 仍可用

社区实测

社区普遍认可 Gemma 4 31B 是参数效率极高的开源模型,在本地编程助手、前端生成和 agentic 工作流场景表现亮眼,部署门槛低且推理速度快;但在深度推理上仍不及闭源旗舰模型,与 Qwen 3.6 各有胜负、用户偏好分化明显。

  • 本地编程助手场景可用,能在 Mac Studio、RTX 3090 等消费级硬件上运行
  • 高上下文场景下召回能力优于 GLM 5.0/5.1
  • 正向偏见(positivity bias)低于 GLM 5 系列
  • 在 FoodTruck Bench 上击败 Qwen 3.5 397B 及所有 Claude Sonnet 版本
  • 前端/UI 生成(SVG、产品页、移动端界面)实测可用
  • 欧洲语言和西方世界知识表现优于 Qwen
  • 支持多模态输入,可在本地运行 agentic 工作流
  • Apache 2.0 许可证,允许商用
  • 可在手机上通过 AI Edge Gallery 运行
  • 在 Mac M2 上可达约 3000 tokens/s 的推理速度
  • 深度推理仍无法触及前沿闭源模型水平
  • 有用户表示 90% 的场景更偏好 Qwen 3.6
  • 在手机上运行速度偏慢
  • 有用户认为 Qwen 3.6 完全碾压 Gemma 4

截至 2026-06-28

快速上手

ollama run hf.co/pearsonkyle/gemma-4-31b-imatrix-GGUF:IQ2_M