DiffusionGemma-26B-A4B-it (Google)
离散扩散文本生成,支持图像/视频输入,低延迟
社区实测
社区普遍将其视为一款以速度换质量的实验性开放模型,在单张桌面 GPU 上即可跑出 700+ tok/s,但精度明显弱于同规模的 Gemma 4 自回归模型,Google 官方也建议质量优先场景用 Gemma 4。适合对延迟敏感、对输出质量容忍度较高的批量生成任务,但高并发云服务场景下并行解码的优势会递减。
- 单张桌面 GPU 可本地运行 26B MoE 模型(如 RTX 5090 上 700+ tok/s)
- 文本生成速度达自回归模型的约 4 倍,低批量下 H100 超 1100 tok/s
- Apache 2.0 开源权重,可自由商用与二次开发
- 支持文本、图像、视频多模态输入
- 256K token 上下文窗口
- 原生支持函数调用(function calling)
- 支持 35+ 种语言的多语言推理
- 支持 vLLM、HuggingFace Transformers、SGLang、MLX 等多种推理框架
- 支持 Unsloth 高效微调
- 精度不如同规模的 Gemma 4 26B 自回归模型,Google 官方建议质量优先时用 Gemma 4
- 预填充(prefill)性能未改善,是网页搜索/工具调用场景的瓶颈
- 高 QPS 云服务场景下并行解码优势递减,可能导致更高的服务成本
- 内容审查比 Gemma 4 31B 更严格,无法处理 NSFL 内容
- llama.cpp 支持在社区讨论时尚未就绪,本地部署选项受限
来源
DiffusionGemma: Google Bets Diffusion Can Make Text Generation 4x Faster - Developers DigestGoogle DiffusionGemma: First Open-Weight Text DiffusionGoogle just dropped DiffusionGemma 26B as an Apache 2.0 model ...google/diffusiongemma-26B-A4B-it - Hugging Facediffusiongemma-26b-a4b-it Model by Google - Nvidia NIMDiffusionGemma: The Developer Guide- Google Developers BlogDiffusion Gemma 26b model performance on DGX Spark - FacebookAnyone tried DiffusionGemma 26B A4B? : r/SillyTavernAI - RedditDiffusionGemma: The Developer Guide
截至 2026-06-21
快速上手
DiffusionGemmaForBlockDiffusion.from_pretrained("google/diffusiongemma-26B-A4B-it", device_map="auto")