SummFlow 2026-05-21 Hugging Face

Nemotron-Labs-Diffusion-14B (NVIDIA)

三模式 LM (AR/扩散/自推测),为 AI 应用开发者提供高效生成

入选理由
有推理代码但无现成接口;仅官方宣传;模型架构创新
对位
对位 Qwen3-8B / Eagle3
适合
高吞吐对话生成(自推测解码) / 边缘设备单用户加速推理(DGX Spark)
不适合
长文本场景(上下文长度未公开)
规模
14B · 未知 · Q4 ~8.9GB / FP16 ~32GB
授权
NVIDIA Nemotron Open Model License
框架
transformers
可信度
自推测接受长度 3× vs Qwen3-8B-Eagle3,DGX Spark 上 2.7× 加速 (w4a16)

仅 safetensors · 无 pickle 加载风险

社区实测

技术架构新颖(三模态),但社区实际使用率低,多数讨论停留在技术介绍层面

  • 同一模型支持自回归与扩散两种解码方式,可通过切换注意力模式实现
  • 针对Nvidia硬件优化,支持TensorRT检查点以提升推理性能
  • 社区实际使用案例稀少,有用户直接质疑是否有人真正在用
  • 部分讨论将其与图像生成模型(eDiffi/DALL-E)混淆,存在认知偏差

截至 2026-06-28

快速上手

transformers from_pretrained()