模型 / DiffusionGemma-26B-A4B-it (Google)

DiffusionGemma-26B-A4B-it (Google)

离散扩散文本生成,支持图像/视频输入,低延迟

作者 unsloth

仓库标识unsloth/diffusiongemma-26B-A4B-it-GGUF

显存未知许可 可商用任务 视觉理解最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
transformers
下载
17,666

Hugging Face 源仓库 ↗

适合与不适合

入选理由
DiffusionGemma的GGUF量化版,支持快速文本扩散生成,需编译llama.cpp特殊分支,适合高级用户体验新架构。
对位
对位 Gemma 4 26B A4B 自回归版
适合
低延迟多模态对话 / 图像/视频文本生成
不适合
不适宜高难度数学竞赛及长文本精确任务

独立证据与社区反馈

12 个独立来源 · 另 1 官方/转载最近验证 2026-08-09

社区把它视为 2026 年技术层面最有意思的开源项目之一:基于 Gemma 4 26B A4B 的扩散式解码并行生成 256-token 块,在专用显卡上文本生成速度最高约 4 倍于同系(单卡 H100 实测超 1000 t/s),适合本地低延迟、低并发部署。不过社区实测普遍指出它在各项基准上都弱于 Gemma 4 26B A4B,Google 官方亦不否认,整体口碑是「有趣的实验」多于「可日常替换的主力」。

  • 专用显卡上的文本生成吞吐:单卡 H100 实测超 1000 t/s,最高约 4 倍于同系 Gemma
  • 面向低延迟本地、低并发推理场景的部署需求
  • 以 25.2B 总参/3.8B 激活的算力成本,达到接近 31B 级的生成品质
  • 256K 长上下文窗口(同系 Gemma 4 26B A4B 社区实测在约 94% 上下文长度下仍可正常生成)
  • 少见的开源多模态扩散式生成,社区认可其多模态能力,视觉基准有实绩(MATH-Vision 70.5%)
  • 推理、代码与长上下文基准成绩(MMLU Pro 77.6%、GPQA Diamond 73.2%)
  • 可配置思考模式、原生函数调用、支持 35+ 语言
  • 部署路径清晰:官方 NVFP4 量化与社区 FP8 recipe 均可参考
  • 各项基准上全面弱于 Gemma 4 26B A4B,Google 官方亦承认
  • 扩散式加速对 MoE 架构的增益属中等水平(社区对比单步并行 16 token、类 MTP 方案),并非无差别 4 倍
  • 速度优势依赖专用 GPU(独显/H100 级),普通硬件上难以发挥,自部署门槛不低
  • 官方定位实验性架构,社区口碑仍不及同门 Gemma 4 26B A4B,多属技术尝鲜而非日常主力

可信度Google DeepMind开源,Apache 2.0,Unsloth提供GGUF,下载量1.7万

完整规格

规模
25.2B (3.8B active) · 256k · 权重格式未知,无法估算显存
授权
Apache 2.0 · 可商用
框架
transformers / llama.cpp / unsloth
血统
量化自 diffusiongemma-26B-A4B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 17.6k → 17.3k · likes +13

观测时间线

模型家族

查看全部家族 →