模型 / Nemotron-3-Nano-Omni-30B-A3B (NVIDIA)

Nemotron-3-Nano-Omni-30B-A3B (NVIDIA)

NVIDIA 多模态推理模型 GGUF 量化版,本地推理用

作者 lmstudio-community

仓库标识lmstudio-community/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-GGUF

显存未知最近核对 2026-08-09
运行内存
权重格式未知,无法估算显存
运行时
LLAMA-SERVER
下载
168,900

Hugging Face 源仓库 ↗

快速上手示例

llama-server -hf lmstudio-community/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-GGUF

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
GGUF格式可直接在LM Studio/Ollama本地运行,下载量高但仅量化版本,无新能力
对位
对位 3B 激活量的推理模型
适合
本地多模态对话 / 图像理解与推理
不适合
生产级高并发推理

独立证据与社区反馈

5 个独立来源最近验证 2026-08-09

推理速度快、长上下文召回优秀,但编程/Agent 任务不如 Qwen 3.5 35B A3B,且量化版本与工具调用存在问题

  • 推理速度快(140+ tokens/s),适合本地部署
  • 长上下文(800k)下多 needle 召回准确
  • 提示处理速度快,适合作为子 Agent 使用
  • 编程和 Agent 任务表现不如 Qwen 3.5 35B A3B
  • 量化版本存在稳定性问题
  • 不支持工具调用(Hermes Agent 下无法使用)
  • 30B 系列模型即使处理非时事内容也倾向依赖在线资源

可信度HuggingFace 168900 下载,LM Studio 社区精选

完整规格

规模
30B (3B 激活) · 权重格式未知,无法估算显存
授权
NVIDIA Open Model Agreement
框架
llama.cpp / ollama / lm-studio
血统
量化自 Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 60.8k → 54.1k · likes +1

观测时间线