模型 / DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)

DiffusionGemma-26B-A4B-it-NVFP4 (NVIDIA)

扩散多模态文本生成,3.8B活跃参数,NVFP4量化

作者 nvidia

仓库标识nvidia/diffusiongemma-26B-A4B-it-NVFP4

显存未知许可 可商用任务 文本生成最近核对 2026-08-05
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
vllm
下载
49,070

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

适合与不适合

入选理由
这是DiffusionGemma的NVFP4量化版,提供vLLM命令和Docker镜像,可快速部署对话/图像视频理解应用,需Hopper或Blackwell GPU。
对位
对位 3B-4B 稠密模型,如 Llama-3.2-3B
适合
多模态文档/图像理解与问答 / 代码生成与函数调用代理
不适合
不保证事实准确性,不适合关键决策

独立证据与社区反馈

7 个独立来源 · 另 2 官方/转载最近验证 2026-08-05

推理速度显著快于常规 Gemma 4(实测 4-6 倍加速),但以牺牲事实准确性为代价,官方明确建议事实敏感场景使用常规版。单卡 RTX 5090 即可部署,文档解析/OCR 是明确优势场景,但结构化输出和 tool calling 精度不足。

  • 推理速度极快,实测在 RTX 5090 上可达 700+ tok/s,H100 上可达 1,100+ tok/s
  • NVFP4 量化后仅需约 18GB VRAM,单张 RTX 5090 即可部署 26B 规模模型
  • 文档解析/OCR 场景(OmniDocBench)表现优于常规 Gemma 4,双向注意力机制带来结构优势
  • 支持 256K token 上下文窗口,可处理长文档
  • 原生支持 function calling 和 agentic workflow
  • 多模态输入(文本、图像、视频),覆盖 35+ 语言
  • 降低推理服务成本,提高并发,适合企业级高吞吐量应用
  • Apache 2.0 开源许可
  • 事实准确性差,实测错误率是常规 Gemma 4 的约 6 倍(33 正确 vs 28 错误),官方明确质量低于常规版
  • 易编造人名、日期、数字等细节(如虚构 Steve Jobs 母亲的名字、虚构同事名字、编造产品价格)
  • 冷门话题准确性更差(Jobs 4 错,Tetris 12 错,BeOS 12 错)
  • Tool calling 精度不足,社区反馈需要更高精确度的场景表现不佳
  • 非数据中心 GPU 上 NVFP4 支持存在兼容性问题
  • 多 GPU 配置存在问题
  • JSON 输出存在 delimiter 拆分 bug 和引号重复问题(BF16 版本同样存在)
  • Google 官方将其定位为实验性模型,明确建议事实敏感场景使用常规 Gemma 4

可信度下载 4.9 万,NVFP4 量化版 GPQA Diamond 68.6% vs 全精度 69.4%

完整规格

规模
25.2B (3.8B活跃) · 256k · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
Apache 2.0 (Gemma Terms) · 可商用
框架
vllm
工具调用
Gemma4 原生工具调用
血统
量化自 diffusiongemma-26B-A4B-it
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 108.4k → 29.6k · likes +5

观测时间线

模型家族

查看全部家族 →