此页是 2026-07-09 的观测快照,查看该模型当前信息 → /m/nvidia__nvidia-nemotron-labs-3-puzzle-75b-a9b-nvfp4/

归档 / 2026-07-09 / NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B (NVIDIA)

面向高吞吐推理的压缩 MoE 模型,用于交互式推理与高并发部署

  • 已量化
入选理由
75B参数但仅9.3B活跃,推理效率高,支持1M上下文和Agent任务,需Blackwell/Hopper多卡部署,提供vLLM和Transformers现成示例。
对位
对位 Mixtral-8x7B (活跃 12.9B)
适合
高并发聊天与代理部署 / 推理密集与长上下文任务
不适合
非 Blackwell GPU 低显存设备
规模
75B (9.3B active) · 1M · Q4 ~29GB / FP16 ~107GB
授权
OpenMDW-1.1 · 需自查
框架
vllm / transformers
工具调用
qwen3_coder 格式
血统
量化自 NVIDIA-Nemotron-3-Super-120B-A12B-BF16
可信度
附技术报告与 Nemo Evaluator SDK 可复现评估

仅 safetensors · 无 pickle 加载风险

快速上手

vllm serve nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 --trust-remote-code --mamba-backend flashinfer

评分详情

Q1
今天能接上用吗   5 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   3 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-07-09)

作者
nvidia
任务类型
text-generation
推理库
transformers
下载
47
点赞
66
许可证
OpenMDW-1.1
标签
transformers, safetensors, nemotron_h_puzzle, text-generation, nvidia, pytorch, nemotron-3, latent-moe, mtp, conversational, custom_code, en, fr, es, it, de, ja, zh, dataset:nvidia/nemotron-post-training-v3, dataset:nvidia/nemotron-pre-training-datasets, arxiv:2607.04371, arxiv:2411.19146, arxiv:2604.12374, arxiv:2512.20848, base_model:nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, base_model:quantized:nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, license:other, 8-bit, modelopt, region:us

探索

源链接