模型 / Nemotron-3-Nano-30B-A3B (NVIDIA)

Nemotron-3-Nano-30B-A3B (NVIDIA)

4bit MoE本地运行于Apple Silicon

作者 mlx-community

仓库标识mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit

显存未知许可 需自查任务 文本生成最近核对 2026-08-05
运行内存
格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
运行时
MLX_LM
下载
855

仅 safetensors · 无 pickle 加载风险

Hugging Face 源仓库 ↗

快速上手示例

mlx_lm.generate --model mlx-community/NVIDIA-Nemotron-3-Nano-30B-A3B-OptiQ-4bit

依赖版本和硬件参数请以源仓库说明为准。

适合与不适合

入选理由
Nemotron 3 Nano的MLX 4-bit量化版,OptiQ混合精度比标准量化质量更高,可在Apple Silicon本地运行文本生成,适合Mac开发者本地部署高性能模型。
对位
对位 Qwen2.5-3B / Llama-3.2-3B
适合
Apple Silicon本地高效推理 / 代码与数学问题求解
不适合
需要高精度BF16的场景

独立证据与社区反馈

4 个独立来源最近验证 2026-08-05

社区反馈两极:在好硬件上速度快、上下文长,适合工具调用场景,但代码分析可靠性不足,不能替代专用编码模型

  • 在好硬件上推理速度极快,适合工具调用和代码分析
  • 支持最高 1M 上下文且保持合理精度
  • 可在 16 GB 消费级显卡上运行,约 20 tokens/s
  • 工具集成能力强,AIME 2025 带 Python 工具可达 99.2%
  • 代码分析任务中容易产生幻觉,无法替代专用编码 agent
  • 部分用户认为 Qwen 3 Coder 30B A3B 更快且更优
  • 9.6% 幻觉率,与 qwen3-next-80b-a3b-thinking(9.3%)接近但模型小得多
  • 30B 参数却叫 Nano 有误导性

可信度MLX社区855下载,6基准全胜统一4bit量化

完整规格

规模
30B (3B 激活) · 格式线索互相矛盾(含估算映射未支持的位宽),无法估算显存
授权
nvidia-open-model-license · 需自查
框架
mlx
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 264 → 247

观测时间线