模型 / NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署

作者
nvidia
对位
对位 Mixtral-8x7B (活跃 12.9B)
适合
高并发聊天与代理部署 / 推理密集与长上下文任务
不适合
非 Blackwell GPU 低显存设备
入选理由
75B参数但仅9.3B活跃,推理效率高,支持1M上下文和Agent任务,需Blackwell/Hopper多卡部署,提供vLLM和Transformers现成示例。
规模
75B (9.3B active) · 1M · 最低 ~49GB · 8-bit(估算)
授权
OpenMDW-1.1 · 需自查
框架
vllm / transformers
工具调用
qwen3_coder 格式
血统
量化自 NVIDIA-Nemotron-3-Super-120B-A12B-BF16
国内访问
需代理
可信度
附技术报告与 Nemo Evaluator SDK 可复现评估

社区实测

当前唯一吃满多张 24GB 消费级显卡的 75B/9B 活跃 MoE 选项,在吞吐和显存效率上对母模型有明显提升,但基准分数有可见回退。

  • 75B 总参 / ~9B 活跃 MoE 的量化规格正好填满 3×24GB VRAM,解决了 70-80B 档位缺少现代模型的空白
  • W4A16 量化后可在 2×3090 上跑满 262K 上下文,无需 CPU offload,TTFT 低至 0.61s
  • 相比 Nemotron Super 120B MoE 在消费级显卡上节省一张卡,指令遵循更好,每瓦吞吐约翻倍
  • 单 H100 上权重从 70GB 降至 44.5GB,1M 上下文并发从 1 提升到 8
  • Arena-Hard-V2 (-4.2) 和 SWE-Bench (-2.6) 是压缩的主要能力代价
  • 需要 PIECEWISE CUDA graphs 等精细配置才能达到高 decode 速度,FULL graphs 无法在 24GB 卡上运行
  • Prefill 密集型场景下吞吐提升仅 1.60x,收益明显低于 decode 密集型场景

截至 2026-07-19

本形态 ~49GB 8-bit · 国内 需代理 · 47 下载

仅 safetensors · 无 pickle 加载风险

快速上手

vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer

本形态源 ↗

下载动量

30天下载 38.8k → 52.4k

观测时间线