模型 / NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署

作者 nvidia

仓库标识nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4

显存未知许可 需自查任务 文本生成最近核对 2026-08-05
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
VLLM
下载
47

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
75B参数但仅9.3B活跃,推理效率高,支持1M上下文和Agent任务,需Blackwell/Hopper多卡部署,提供vLLM和Transformers现成示例。
对位
对位 Mixtral-8x7B (活跃 12.9B)
适合
高并发聊天与代理部署 / 推理密集与长上下文任务
不适合
非 Blackwell GPU 低显存设备

独立证据与社区反馈

3 个独立来源最近验证 2026-08-05

用少量消费级 GPU 可跑 75B MoE,指令遵循和每瓦速度优于上一代 Nemotron MoE,但推测解码的浪费率偏高。

  • 在 3×3090 上实现 132 t/s,每瓦速度约为 Nemotron Super 120B 的两倍
  • 指令遵循能力优于同系列上一代 Nemotron Super 120B
  • 内置推测解码,draft 模型与主模型共享 checkpoint 和 tokenizer,无需额外部署
  • 推测解码在不同任务上浪费率 22%-40%,code 类任务浪费最高达 40%
  • 131K 上下文长度下需将 GPU 内存利用率降至 0.5 才能保证 4 并发序列

可信度附技术报告与 Nemo Evaluator SDK 可复现评估

完整规格

规模
75B (9.3B active) · 1M · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
OpenMDW-1.1 · 需自查
框架
vllm / transformers
工具调用
qwen3_coder 格式
血统
量化自 NVIDIA-Nemotron-3-Super-120B-A12B-BF16
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 156k → 6.5k · likes +2

观测时间线