模型 / Nemotron-3.5-Lightning-30B-A3B (NVIDIA)

Nemotron-3.5-Lightning-30B-A3B (NVIDIA)

30B 总参 / 3B 激活 MoE,本地 GGUF 部署

作者 nvidia

仓库标识nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16

~19GB 4-bit许可 需自查任务 文本生成最近核对 2026-08-14

仅 safetensors · 无 pickle 加载风险

格式
4-bit
文件
~16GB
运行内存
~19GB–25GB
运行时
VLLM
下载
15,740

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
NVIDIA Nemotron 3.5 Lightning 30B A3B 的 GGUF 量化版,可直接在 LM Studio/llama.cpp 本地运行,适合需要高效本地推理的用户。
对位
对位 Qwen3-30B-A3B
适合
LM Studio 本地对话 / 低激活成本批量生成
不适合
复杂多步推理或长上下文任务

完整规格

规模
30B (A3B 激活) · 1M · 下载 ~16GB · 显存最低 ~19GB · 推荐 ~25GB · 4-bit(估算)
授权
OpenMDW-1.1 · 需自查
框架
llama.cpp
工具调用
OpenAI-style
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 378.6k → 449.1k

观测时间线