模型 / Nemotron-3-Nano-Omni-30B-A3B (NVIDIA)

Nemotron-3-Nano-Omni-30B-A3B (NVIDIA)

NVIDIA 多模态推理模型 GGUF 量化版,本地推理用

作者
lmstudio-community
对位
对位 3B 激活量的推理模型
适合
本地多模态对话 / 图像理解与推理
不适合
生产级高并发推理
入选理由
GGUF格式可直接在LM Studio/Ollama本地运行,下载量高但仅量化版本,无新能力
规模
30B (3B 激活) · 最低 ~18GB · 4-bit(估算)
授权
NVIDIA Open Model Agreement
框架
llama.cpp / ollama / lm-studio
血统
量化自 Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16
国内访问
需代理
可信度
HuggingFace 168900 下载,LM Studio 社区精选

社区实测

在 30B MoE 量级中推理速度与长上下文表现亮眼,编码和通用问答超出预期,但风格偏机械,不适合创意/闲聊。

  • 在有限消费级硬件上实现 256K 上下文(可溢出至 1M),推理速度在 30B 级别中明显更快
  • 在个人编码测试中首次本地模型一次通过,生成可用代码,接近闭源模型的编码体验
  • 在多位用户的通用问答对比中,30B 规模的表现常优于 Llama 3.3 70B
  • 风格机械生硬,不适合创意写作或对话式交互
  • 官方宣称的 4 倍速度在实测中属于夸大,实际提升未达该倍数
  • 不同量化版本间性能差异明显,需要自行测试匹配硬件

截至 2026-07-19

本形态 ~18GB 4-bit · 国内 需代理 · 168,900 下载

快速上手

llama-server -hf lmstudio-community/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-GGUF

本形态源 ↗

下载动量

30天下载 102.8k → 93.2k · likes +1

观测时间线