此页是 2026-07-09 的观测快照,查看该模型当前信息 → /m/nvidia__nvidia-nemotron-labs-3-puzzle-75b-a9b-nvfp4/
归档 / 2026-07-09 / NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)
NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)
面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署
- 入选理由
- 75B参数但仅9.3B活跃,推理效率高,支持1M上下文和Agent任务,需Blackwell/Hopper多卡部署,提供vLLM和Transformers现成示例。
- 对位
- 对位 Mixtral-8x7B (活跃 12.9B)
- 适合
- 高并发聊天与代理部署 / 推理密集与长上下文任务
- 不适合
- 非 Blackwell GPU 低显存设备
- 规模
- 75B (9.3B active) · 1M · Q4 ~29GB / FP16 ~107GB
- 授权
- OpenMDW-1.1 · 需自查
- 框架
- vllm / transformers
- 工具调用
- qwen3_coder 格式
- 血统
- 量化自 NVIDIA-Nemotron-3-Super-120B-A12B-BF16
- 可信度
- 附技术报告与 Nemo Evaluator SDK 可复现评估
仅 safetensors · 无 pickle 加载风险
快速上手
vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer 点击复制
评分详情
- Q1
- 今天能接上用吗 5 / 5
- Q2
- 有可信证据吗 1 / 5
- Q3
- 是新东西吗 3 / 5
- 总分
- 9
HuggingFace 原始数据 (抓取于 2026-07-09)
- 作者
- nvidia
- 推理库
- transformers
- 下载
- 47
- 点赞
- 66
- 许可证
- OpenMDW-1.1
- 标签
- transformers, safetensors, nemotron_h_puzzle, text-generation, nvidia, pytorch, nemotron-3, latent-moe, mtp, conversational, custom_code, en, fr, es, it, de, ja, zh, dataset:nvidia/nemotron-post-training-v3, dataset:nvidia/nemotron-pre-training-datasets, arxiv:2607.04371, arxiv:2411.19146, arxiv:2604.12374, arxiv:2512.20848, base_model:nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, base_model:quantized:nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, license:other, 8-bit, modelopt, region:us
探索
源链接