Nemotron-3-Nano-Omni-30B-A3B (NVIDIA)
NVIDIA 多模态推理模型 GGUF 量化版,本地推理用
社区实测
在 30B MoE 量级中推理速度与长上下文表现亮眼,编码和通用问答超出预期,但风格偏机械,不适合创意/闲聊。
- 在有限消费级硬件上实现 256K 上下文(可溢出至 1M),推理速度在 30B 级别中明显更快
- 在个人编码测试中首次本地模型一次通过,生成可用代码,接近闭源模型的编码体验
- 在多位用户的通用问答对比中,30B 规模的表现常优于 Llama 3.3 70B
- 风格机械生硬,不适合创意写作或对话式交互
- 官方宣称的 4 倍速度在实测中属于夸大,实际提升未达该倍数
- 不同量化版本间性能差异明显,需要自行测试匹配硬件
截至 2026-07-19
本形态 ~18GB 4-bit · 国内 需代理 · 168,900 下载
快速上手
llama-server -hf lmstudio-community/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-GGUF 下载动量
30天下载 102.8k → 93.2k · likes +1