此页是 2026-05-21 的观测快照,查看该模型当前信息 → /m/lmstudio-community__gemma-4-31b-it-gguf/

归档 / 2026-05-21 / Gemma-4-31B-it-GGUF (LM Studio)

Gemma-4-31B-it-GGUF (LM Studio)

Google 31B 指令模型 GGUF 量化版,本地消费级硬件推理

入选理由
GGUF格式可直接在LM Studio/Ollama运行;仅为量化重打包,非新能力。
对位
对位 Qwen2.5-32B、Llama-3.1-70B 蒸馏版
适合
本地高参数量指令遵循与对话 / 长上下文理解与 RAG 应用
不适合
4GB 以下显存设备运行
规模
31B · 未知
授权
apache-2.0 · 可商用
框架
llama.cpp / ollama / LM Studio
血统
量化自 gemma-4-31B-it
可信度
HuggingFace 下载量 34 万,基于 Google gemma-4-31B-it 量化

社区实测

Gemma 4 31B 不是最聪明的本地模型,但因其综合可用性和离线能力成为许多人日常首选;一次性编码表现亮眼,工具调用场景则逊色不少;消费级硬件可跑但量化版本选择与 VRAM 策略直接影响体验。

  • 本地离线推理,适合通勤、旅行、无网络环境
  • 通过 GPU offloading 在消费级笔记本(如 RTX 5080 Laptop 16GB VRAM)上运行大参数量模型
  • 多模态输入(文本+图像)
  • 工具调用与推理能力
  • 256K 长上下文窗口
  • 通过推测解码(speculative decoding)加速推理
  • 兼容多种推理框架:llama.cpp、Ollama、Unsloth Studio、Docker Model Runner 等
  • lmstudio-community 的 GGUF 量化不在 KL 散度 Pareto 前沿(Q8_0 除外),品质不如 unsloth 或 bartowski 的量化
  • 长文档和非拉丁脚本在低精度量化下退化最快,即使 Q8_0 也有明显 KL 散度
  • 推测解码若草稿模型选择不当,速度反而比不用更慢(实测 7.31 t/s vs 57 t/s 基线)
  • LM Studio 中 31B 版本的 thinking mode 开关可能不显示,需通过官网「use this model in LM Studio」按钮或手动修改聊天模板修复
  • 编码任务需将 temperature 降至 0.3 或更低,默认 1.0 会产生大量错误
  • 工具调用/自定义 harness 场景下表现不如一次性编码
  • 密集模型对内存带宽要求高,不适合低带宽设备(如 NVIDIA Spark)
  • 低精度量化下滑动窗口注意力与 KV cache 复用可能导致长上下文误差累积

截至 2026-06-21

快速上手

ollama run hf.co/lmstudio-community/gemma-4-31B-it-GGUF:Q4_K_M

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   1 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-05-21)

作者
lmstudio-community
任务类型
unknown
推理库
未指定
下载
340,436
点赞
25
许可证
apache-2.0
标签
gguf, base_model:google/gemma-4-31B-it, base_model:quantized:google/gemma-4-31B-it, license:apache-2.0, endpoints_compatible, region:us, conversational

探索

源链接