NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)
面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署
仓库标识nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
显存未知许可 需自查任务 文本生成最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
- 运行内存
- 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
- 运行时
- VLLM
- 下载
- 47
仅 safetensors · 无 pickle 加载风险
快速上手示例
vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer 依赖版本和硬件参数请以源仓库说明为准。
适合与不适合
独立证据与社区反馈
用少量消费级 GPU 可跑 75B MoE,指令遵循和每瓦速度优于上一代 Nemotron MoE,但推测解码的浪费率偏高。
- 在 3×3090 上实现 132 t/s,每瓦速度约为 Nemotron Super 120B 的两倍
- 指令遵循能力优于同系列上一代 Nemotron Super 120B
- 内置推测解码,draft 模型与主模型共享 checkpoint 和 tokenizer,无需额外部署
- 推测解码在不同任务上浪费率 22%-40%,code 类任务浪费最高达 40%
- 131K 上下文长度下需将 GPU 内存利用率降至 0.5 才能保证 4 并发序列
- 独立评测nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
- 基准/排行Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs
- 社区实测NVIDIA Puzzle-75B-A9B NVFP4 at 132 t/s on 3×3090
可信度附技术报告与 Nemo Evaluator SDK 可复现评估
完整规格
下载动量
30天下载 156k → 6.5k · likes +2