Gemma-4-26B-A4B-QAT-GGUF (Unsloth)
Gemma 4 26B MoE 量化版,用于本地图像与文本推理
仓库标识unsloth/gemma-4-26B-A4B-it-qat-GGUF
显存未知许可 可商用任务 视觉理解最近核对 2026-08-09
链接指向的配置 不在本页收录的形态里,已显示默认形态(GGUF·unsloth)。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- OLLAMA
- 下载
- 60,001
快速上手示例
ollama run unsloth/gemma-4-26B-A4B-it-qat-GGUF 依赖版本和硬件参数请以源仓库说明为准。
- 运行内存
- 权重格式未知,无法估算显存
- 运行时
- llama.cpp
- 下载
- 8,334
适合与不适合
独立证据与社区反馈
社区整体把它当作「高性价比的全能本地模型」:仅约 3.8B 激活参数却带来接近 31B 级别的质量(12),是同代开源权重里生成/预填充速度最快的之一(4),对比 12B 还快约 1.7 倍(13);语言学习、科学问答和写作创意上口碑很好(1)(5)。但编程输出常被批过于简单粗糙、缺关键细节(2),推理速度也不适合在线实时场景(8),因此更被推荐用于本地部署与原型验证。
- 语言学习与科学问题问答被用户评为「体验最好的模型」(1)
- 写作与创意类任务明显更强,社区常把它与「负责编程」的 Qwen 搭配分工(5)
- 超长上下文稳定:在 245283/262144(94%)的上下文下仍完全可用(0)
- 消费级 GPU/工作站部署:仅 3.8B 激活参数、近 31B 级质量,计算成本低(12)(15)
- 同代开源权重中 TG/PP 速度最佳,llama.cpp 下单并发可持续 51.57 t/s(4)(14)
- 快速原型验证:1.63s TTFT、46.7 t/s 足以在投入生产前验证模型行为(8)
- 易与本地工具链集成,可经 ACP 接入 Opencode/Zed 做代码审查和小型前端片段(6)
- 原生函数调用与 system prompt 支持,适合智能体/agentic 任务(15)
- 编程输出简单粗暴:常给出非常基础、缺失小细节的代码,问题会随时间累积放大,即使给很具体的指令也一样(2)
- 在线实时场景速度不够:1.63s TTFT 与 46.7 t/s 对 live、面向用户的应用没有竞争力,更偏原型用途(8)
- 48k 有效上下文在一些后端支持仍较粗糙(4)
- vLLM 明显慢于 llama.cpp:约 30 t/s 对 51.57 t/s,选对推理后端很重要(14)
- 内存不足的机器(如低配 M3 Max)无法把上下文扩到实用程度(6)
- 智能/编程/智能体榜单排名中游:整体智能 #112/393、编程 #60/157、智能体 #139/300(10)
- 量化版本口碑两极:有用户在特定 Q4_K_M 上体验极差并称「最差模型」,社区建议换用 Bartowski 的量化(1)(3)
- 共享 GPU 环境下并发扩展的实际效率必然低于理想线性扩展(11)
- 社区实测Gemma 4 26B A4B is genuinely the best model I have tried for language learning and scientific queries!
- 社区实测Gemma 4 26b is the perfect all around local model and I'm surprised how well it does.
- 社区实测Gemma 4 26B A4B is still fully capable at 245283/262144 (94%) context!
- 独立评测Gemma 4 26B A4B API Benchmarks: Latency, Throughput & Cost
- 社区实测Gemma 4 26B A4B IT QAT Comparison
- 社区实测New Google Gemma 4 12B Claims Near-26B Performance - We Tested Both!
- 社区实测I'm currently experimenting with running google/gemma-4-26b-a4b with lm studio (Hacker News)
- 社区实测Gemma 4 - lazy model or am I crazy? (bit of a rant)
- 独立评测Benchmarking Gemma-4-26B (A4B) on the DGX Spark | James Tang
- 独立评测Gemma 4 26B A4B - Intelligence, Performance & Price Analysis
- 社区实测Gemma-4-26B-A4B-it-UD-Q4_K_M.gguf : IMHO worst model ever. What am I doing wrong?
- 转载/仓库google/gemma-4-26B-A4B-it · Hugging Face
可信度下载 60k+,基于 Google 官方 QAT 检查点,Unsloth 动态量化
完整规格
下载动量
30天下载 698.8k → 683.9k · likes +40