模型 / Nemotron-Labs-TwoTower-30B-A3B (NVIDIA)

Nemotron-Labs-TwoTower-30B-A3B (NVIDIA)

双塔扩散LLM,块并行解码,2.42x生成吞吐量

作者
nvidia
对位
对位Qwen2.5-3B等3B激活模型
适合
大规模批量文本生成 / 作为基座模型微调
不适合
低延迟对话或指令跟随
入选理由
扩散语言模型,块状并行生成,速度2.42倍,保留质量98.7%;需2张A100/H100。适合追求高吞吐的文本生成。
规模
30B (3B 激活) · 128k · 最低 ~18GB · 4-bit(估算)
授权
NVIDIA Nemotron Open Model License · 需自查
框架
transformers
国内访问
需代理
可信度
基于Nemotron-3-Nano骨干,2.1T tokens训练,基准保留98.7%质量,HuggingFace 7.6k下载

社区实测

社区实测样本极少,个别用户反馈在低配硬件上可流畅运行,但整体口碑尚未形成

  • 低配硬件可运行(6GB VRAM 旧游戏本)且保持实用推理速度
  • 针对 NVIDIA 硬件优化,支持 TensorRT 以最大化性能
  • 社区实测反馈极少,除个别用户外缺乏广泛真实使用验证

截至 2026-07-12

本形态 ~18GB 4-bit · 国内 需代理 · 7,628 下载

仅 safetensors · 无 pickle 加载风险

快速上手

python3 -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-TwoTower-30B-A3B-Base-BF16',trust_remote_code=True,torch_dtype='bfloat16').cuda()" (单GPU AR模式,约59GB显存)

本形态源 ↗

下载动量

30天下载 11.5k → 11.7k

观测时间线