模型 / Nemotron-3.5-Lightning-30B-A3B (NVIDIA)

Nemotron-3.5-Lightning-30B-A3B (NVIDIA)

3B活跃参数,面向本地Agent和长上下文推理

作者 nvidia

仓库标识nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4

~20GB 8-bit许可 需自查任务 文本生成最近核对 2026-08-12
格式
8-bit
文件
~17GB
运行内存
~20GB–25GB
运行时
VLLM
下载
19,250

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
MoE+Mamba-2混合架构,30B总参仅3B激活,支持1M上下文,官方NVFP4量化可单卡H100跑,适合长程agent部署。
对位
对位 Qwen3-30B-A3B 等 3B 激活 MoE
适合
长时间运行的自主Agent / 本地高效推理部署
不适合
不宜高难度科学推理

完整规格

规模
30B (3B active) · 1M · 下载 ~17GB · 显存最低 ~20GB · 推荐 ~25GB · 8-bit(估算)
授权
OpenMDW-1.1 · 需自查
框架
vllm / tensorrt-llm / sglang
工具调用
OpenAI-style function calling
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 745.2k → 1064.9k

观测时间线