模型 / DiffusionGemma-26B-A4B-it (Google)

DiffusionGemma-26B-A4B-it (Google)

离散扩散文本生成,支持图像/视频输入,低延迟

作者
unsloth
对位
对位 Gemma 4 26B A4B 自回归版
适合
低延迟多模态对话 / 图像/视频文本生成
不适合
不适宜高难度数学竞赛及长文本精确任务
入选理由
DiffusionGemma的GGUF量化版,支持快速文本扩散生成,需编译llama.cpp特殊分支,适合高级用户体验新架构。
规模
25.2B (3.8B active) · 256k · 最低 ~15GB · 4-bit(估算)
授权
Apache 2.0 · 可商用
框架
transformers / llama.cpp / unsloth
血统
量化自 diffusiongemma-26B-A4B-it
国内访问
需代理
可信度
Google DeepMind开源,Apache 2.0,Unsloth提供GGUF,下载量1.7万

社区实测

社区普遍将其视为一款以速度换质量的实验性开放模型,在单张桌面 GPU 上即可跑出 700+ tok/s,但精度明显弱于同规模的 Gemma 4 自回归模型,Google 官方也建议质量优先场景用 Gemma 4。适合对延迟敏感、对输出质量容忍度较高的批量生成任务,但高并发云服务场景下并行解码的优势会递减。

  • 单张桌面 GPU 可本地运行 26B MoE 模型(如 RTX 5090 上 700+ tok/s)
  • 文本生成速度达自回归模型的约 4 倍,低批量下 H100 超 1100 tok/s
  • Apache 2.0 开源权重,可自由商用与二次开发
  • 支持文本、图像、视频多模态输入
  • 256K token 上下文窗口
  • 原生支持函数调用(function calling)
  • 支持 35+ 种语言的多语言推理
  • 支持 vLLM、HuggingFace Transformers、SGLang、MLX 等多种推理框架
  • 支持 Unsloth 高效微调
  • 精度不如同规模的 Gemma 4 26B 自回归模型,Google 官方建议质量优先时用 Gemma 4
  • 预填充(prefill)性能未改善,是网页搜索/工具调用场景的瓶颈
  • 高 QPS 云服务场景下并行解码优势递减,可能导致更高的服务成本
  • 内容审查比 Gemma 4 31B 更严格,无法处理 NSFL 内容
  • llama.cpp 支持在社区讨论时尚未就绪,本地部署选项受限

截至 2026-06-21

本形态 ~15GB 4-bit · 国内 需代理 · 17,666 下载

快速上手

DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", device_map="auto")

本形态源 ↗

下载动量

30天下载 198.8k → 90.3k · likes +41

观测时间线

模型家族

查看全部家族 →