模型 / Nemotron-3.5-ASR-Streaming-0.6B (NVIDIA)

Nemotron-3.5-ASR-Streaming-0.6B (NVIDIA)

覆盖40种语言的流式ASR,600M,可调延迟,面向实时语音代理

作者
nvidia
对位
替代 Parakeet-RNNT-1.1B 多语言 ASR
适合
低延迟多语种语音转写 / 实时多语言语音代理
不适合
未微调的适配语种直接使用
入选理由
多语言流式ASR模型,支持40语种和自动语言检测,缓存感知架构,需NeMo环境部署。
规模
600M · 最低 ~0.4GB · 4-bit(估算)
授权
NVIDIA Open Model License · 需自查
框架
nemo / pytorch
国内访问
魔搭可用
可信度
225下载, 102赞, FLEURS 英语 WER 7.91%@1.12s 块, NVIDIA 发布

社区实测

社区反馈较少,但试用者认为该模型在 CPU 上流式 ASR 表现不错,多语言是主要亮点,英语专用版仍更优,且缺少说话人分离。

  • 在 CPU 上实现接近实时的流式语音识别(~1-2x RTF),内存占用低
  • 单模型覆盖 40 种语言/地区的多语言转录,带缓存感知分块推理
  • 英语输入场景下,英语专用版 Nemotron 效果更好
  • 尚未支持说话人分离(diarization)

截至 2026-07-19

本形态 ~0.4GB 4-bit · 国内 魔搭可用 · 225 下载

仅 safetensors · 无 pickle 加载风险

快速上手

nemo_asr.models.ASRModel.from_pretrained('nvidia/nemotron-3.5-asr-streaming-0.6b')

本形态源 ↗

下载动量

30天下载 289.1k → 541.2k · likes +262

观测时间线