NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)
面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署
社区实测
当前唯一吃满多张 24GB 消费级显卡的 75B/9B 活跃 MoE 选项,在吞吐和显存效率上对母模型有明显提升,但基准分数有可见回退。
- 75B 总参 / ~9B 活跃 MoE 的量化规格正好填满 3×24GB VRAM,解决了 70-80B 档位缺少现代模型的空白
- W4A16 量化后可在 2×3090 上跑满 262K 上下文,无需 CPU offload,TTFT 低至 0.61s
- 相比 Nemotron Super 120B MoE 在消费级显卡上节省一张卡,指令遵循更好,每瓦吞吐约翻倍
- 单 H100 上权重从 70GB 降至 44.5GB,1M 上下文并发从 1 提升到 8
- Arena-Hard-V2 (-4.2) 和 SWE-Bench (-2.6) 是压缩的主要能力代价
- 需要 PIECEWISE CUDA graphs 等精细配置才能达到高 decode 速度,FULL graphs 无法在 24GB 卡上运行
- Prefill 密集型场景下吞吐提升仅 1.60x,收益明显低于 decode 密集型场景
来源
NVIDIA Puzzle-75B-A9B NVFP4 at 132 t/s on 3×3090 — Why is this size category a desert otherwise?NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B on 2x3090sMeet Nemotron Labs 3 Puzzle 75B A9B: A Compressed Hybrid MoE LLM Delivering 2.03x Server Throughput - MarkTechPostReally Cool Research from NVIDIA
截至 2026-07-19
本形态 ~49GB 8-bit · 国内 需代理 · 47 下载
仅 safetensors · 无 pickle 加载风险
快速上手
vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer 下载动量
30天下载 38.8k → 52.4k