SummFlow 2026-07-09 Hugging Face

NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署

  • 已量化
入选理由
75B参数但仅9.3B活跃,推理效率高,支持1M上下文和Agent任务,需Blackwell/Hopper多卡部署,提供vLLM和Transformers现成示例。
对位
对位 Mixtral-8x7B (活跃 12.9B)
适合
高并发聊天与代理部署 / 推理密集与长上下文任务
不适合
非 Blackwell GPU 低显存设备
规模
75B (9.3B active) · 1M · Q4 ~29GB / FP16 ~107GB
授权
OpenMDW-1.1 · 需自查
框架
vllm / transformers
工具调用
qwen3_coder 格式
血统
量化自 NVIDIA-Nemotron-3-Super-120B-A12B-BF16
可信度
附技术报告与 Nemo Evaluator SDK 可复现评估

仅 safetensors · 无 pickle 加载风险

快速上手

vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer