模型 / Nemotron-3-Nano-30B-A3B (NVIDIA)

Nemotron-3-Nano-30B-A3B (NVIDIA)

4bit MoE本地运行于Apple Silicon

作者
mlx-community
对位
对位 Qwen2.5-3B / Llama-3.2-3B
适合
Apple Silicon本地高效推理 / 代码与数学问题求解
不适合
需要高精度BF16的场景
入选理由
Nemotron 3 Nano的MLX 4-bit量化版,OptiQ混合精度比标准量化质量更高,可在Apple Silicon本地运行文本生成,适合Mac开发者本地部署高性能模型。
规模
30B (3B 激活) · Q4 ~20GB / FP16 ~72GB
授权
nvidia-open-model-license · 需自查
框架
mlx
国内访问
需代理
可信度
MLX社区855下载,6基准全胜统一4bit量化

社区实测

30B级别中综合能力突出,推理速度快、长上下文处理高效,编程和通用问答表现优异,但风格偏机械不适合创意写作

  • 在预算有限/异构硬件上流畅运行30B级模型,降低本地AI使用门槛
  • 本地编程辅助:单次提示即可生成正确可用代码,提升开发效率
  • 长上下文处理:256K上下文可完全装入有限VRAM,支持1M扩展
  • 风格偏机械/生硬,不适合创意写作和对话场景
  • 官方宣称的4倍速提升存在夸大,实际提速明显但未达宣称水平
  • 合成数据训练可能影响回答质量
  • 部分基准测试不及GLM 4.7 Flash

截至 2026-07-19

本形态显存 Q4 ~20GB / FP16 ~72GB · 国内 需代理 · 855 下载

仅 safetensors · 无 pickle 加载风险

快速上手

mlx_lm.generate --model mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit

本形态源 ↗

下载动量

观测时间线