此页是 2026-06-15 的观测快照,查看该模型当前信息 → /m/nvidia__diffusiongemma-26b-a4b-it-nvfp4/

归档 / 2026-06-15 / DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)

DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)

扩散多模态文本生成,3.8B活跃参数,NVFP4量化

  • 已量化
入选理由
这是DiffusionGemma的NVFP4量化版,提供vLLM命令和Docker镜像,可快速部署对话/图像视频理解应用,需Hopper或Blackwell GPU。
对位
对位 3B-4B 稠密模型,如 Llama-3.2-3B
适合
多模态文档/图像理解与问答 / 代码生成与函数调用代理
不适合
不保证事实准确性,不适合关键决策
规模
25.2B (3.8B活跃) · 256k · Q4 ~9.5GB / FP16 ~35GB
授权
Apache 2.0 (Gemma Terms) · 可商用
框架
vllm
工具调用
Gemma4 原生工具调用
血统
量化自 diffusiongemma-26B-A4B-it
可信度
下载 4.9 万,NVFP4 量化版 GPQA Diamond 68.6% vs 全精度 69.4%

仅 safetensors · 无 pickle 加载风险

社区实测

速度提升是实打实的(单卡 4-6 倍于同规模自回归模型),但事实性错误率也显著更高;Google 官方建议质量优先时仍用 Gemma 4 自回归版本。当前更适合高吞吐、对精度容忍度高的批处理场景,作为快速初稿生成器而非最终输出模型。

  • 生成速度远超同规模自回归模型,实测 RTX 6000 Pro 上可达 6 倍以上吞吐
  • NVFP4 量化后可在 RTX 5090(32GB)上运行,仅占约 18.8GB VRAM
  • DGX Spark 上单请求可达 101 tok/s,并发 4 时聚合吞吐约 148 tok/s
  • 支持 vLLM 部署,社区已有 Docker 化服务方案
  • 工具调用在实际使用中兼容现有 Hermes profile,可直接替换
  • 首个由一线实验室发布的开源权重文本扩散模型,验证了扩散架构在文本生成上的可行性
  • Blackwell 架构上 NVFP4 利用原生 FP4 tensor core,无需反量化步骤
  • 事实性错误率远高于自回归版本,同一任务实测错误多出约 6 倍
  • 话题越冷门/长尾,生成质量下降越明显(热门话题 4 处错误 vs 冷门话题 12 处错误)
  • Google 官方建议当质量优先时仍应使用 Gemma 4 自回归版本
  • 本地模型能力远不及商业 API,社区提醒需将预期降至十分之一
  • 当前阶段更适合作为快速初稿生成器,需搭配精修模型做二次修正
  • 扩散架构在低并发单用户场景下优势最明显,高并发下相对优势缩小

截至 2026-06-21

快速上手

VLLM_USE_V2_MODEL_RUNNER=1 vllm serve nvidia/diffusiongemma-26B-A4B-IT-NVFP4 --trust-remote-code --max-num-seqs 4 --attention-backend TRITON_ATTN --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 --override-generation-config '{"max_new_tokens": null}' --default-chat-template-kwargs '{"enable_thinking":true}' (需H100/B100)

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   3 / 5
Q3
是新东西吗   1 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-06-15)

作者
nvidia
任务类型
text-generation
推理库
未指定
下载
49,070
点赞
53
许可证
Apache 2.0 (Gemma Terms)
标签
safetensors, diffusion_gemma, nvidia, ModelOpt, DiffusionGemma-26B-A4B-IT, quantized, NVFP4, nvfp4, text-generation, conversational, base_model:google/diffusiongemma-26B-A4B-it, base_model:quantized:google/diffusiongemma-26B-A4B-it, license:apache-2.0, 8-bit, modelopt, region:us

探索

源链接