DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)
扩散多模态文本生成,3.8B活跃参数,NVFP4量化
- 已量化
仅 safetensors · 无 pickle 加载风险
社区实测
速度提升是实打实的(单卡 4-6 倍于同规模自回归模型),但事实性错误率也显著更高;Google 官方建议质量优先时仍用 Gemma 4 自回归版本。当前更适合高吞吐、对精度容忍度高的批处理场景,作为快速初稿生成器而非最终输出模型。
- 生成速度远超同规模自回归模型,实测 RTX 6000 Pro 上可达 6 倍以上吞吐
- NVFP4 量化后可在 RTX 5090(32GB)上运行,仅占约 18.8GB VRAM
- DGX Spark 上单请求可达 101 tok/s,并发 4 时聚合吞吐约 148 tok/s
- 支持 vLLM 部署,社区已有 Docker 化服务方案
- 工具调用在实际使用中兼容现有 Hermes profile,可直接替换
- 首个由一线实验室发布的开源权重文本扩散模型,验证了扩散架构在文本生成上的可行性
- Blackwell 架构上 NVFP4 利用原生 FP4 tensor core,无需反量化步骤
- 事实性错误率远高于自回归版本,同一任务实测错误多出约 6 倍
- 话题越冷门/长尾,生成质量下降越明显(热门话题 4 处错误 vs 冷门话题 12 处错误)
- Google 官方建议当质量优先时仍应使用 Gemma 4 自回归版本
- 本地模型能力远不及商业 API,社区提醒需将预期降至十分之一
- 当前阶段更适合作为快速初稿生成器,需搭配精修模型做二次修正
- 扩散架构在低并发单用户场景下优势最明显,高并发下相对优势缩小
DiffusionGemma vs Gemma 4 Over 6x Faster on a Single RTX 6000 Pro NVFP4. : r/LocalLLMDiffusionGemma vs Gemma 4 Over 6x Faster on a Single RTX 6000 Pro NVFP4. : r/LocalLLaMADiffusionGemma 26B NVFP4 vLLM Notes on NVIDIA DGX Spark, 100+ tok/s : r/Vllmnvidia/Gemma-4-26B-A4B-NVFP4 : r/LocalLLaMA - RedditDiffusion Gemma is 4x faster, but makes 6x more mistakes! - RedditGoogle DiffusionGemma: First Open-Weight Text DiffusionDeploying Gemma 4 26B A4B on an RTX 5090 - Towards AI
截至 2026-06-21
快速上手
VLLM_USE_V2_MODEL_RUNNER=1 vllm serve nvidia/diffusiongemma-26B-A4B-IT-NVFP4 --trust-remote-code --max-num-seqs 4 --attention-backend TRITON_ATTN --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 --override-generation-config '{"max_new_tokens": null}' --default-chat-template-kwargs '{"enable_thinking":true}' (需H100/B100)