NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)
面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署
- 已量化
仅 safetensors · 无 pickle 加载风险
快速上手
vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer
2026-07-09
面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署
仅 safetensors · 无 pickle 加载风险
快速上手
vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer