SummFlow 2026-06-13 Hugging Face

DiffusionGemma-26B-A4B-it (Google)

离散扩散文本生成,支持图像/视频输入,低延迟

入选理由
DiffusionGemma的GGUF量化版,支持快速文本扩散生成,需编译llama.cpp特殊分支,适合高级用户体验新架构。
对位
对位 Gemma 4 26B A4B 自回归版
适合
低延迟多模态对话 / 图像/视频文本生成
不适合
不适宜高难度数学竞赛及长文本精确任务
规模
25.2B (3.8B active) · 256k
授权
Apache 2.0 · 可商用
框架
transformers / llama.cpp / unsloth
血统
量化自 diffusiongemma-26B-A4B-it
可信度
Google DeepMind开源,Apache 2.0,Unsloth提供GGUF,下载量1.7万

社区实测

社区普遍将其视为一款以速度换质量的实验性开放模型,在单张桌面 GPU 上即可跑出 700+ tok/s,但精度明显弱于同规模的 Gemma 4 自回归模型,Google 官方也建议质量优先场景用 Gemma 4。适合对延迟敏感、对输出质量容忍度较高的批量生成任务,但高并发云服务场景下并行解码的优势会递减。

  • 单张桌面 GPU 可本地运行 26B MoE 模型(如 RTX 5090 上 700+ tok/s)
  • 文本生成速度达自回归模型的约 4 倍,低批量下 H100 超 1100 tok/s
  • Apache 2.0 开源权重,可自由商用与二次开发
  • 支持文本、图像、视频多模态输入
  • 256K token 上下文窗口
  • 原生支持函数调用(function calling)
  • 支持 35+ 种语言的多语言推理
  • 支持 vLLM、HuggingFace Transformers、SGLang、MLX 等多种推理框架
  • 支持 Unsloth 高效微调
  • 精度不如同规模的 Gemma 4 26B 自回归模型,Google 官方建议质量优先时用 Gemma 4
  • 预填充(prefill)性能未改善,是网页搜索/工具调用场景的瓶颈
  • 高 QPS 云服务场景下并行解码优势递减,可能导致更高的服务成本
  • 内容审查比 Gemma 4 31B 更严格,无法处理 NSFL 内容
  • llama.cpp 支持在社区讨论时尚未就绪,本地部署选项受限

截至 2026-06-21

快速上手

DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", device_map="auto")