SummFlow 2026-06-05 Hugging Face

Nemotron-3.5-ASR-Streaming-0.6B (NVIDIA)

覆盖40种语言的流式ASR,600M,可调延迟,面向实时语音代理

入选理由
多语言流式ASR模型,支持40语种和自动语言检测,缓存感知架构,需NeMo环境部署。
对位
替代 Parakeet-RNNT-1.1B 多语言 ASR
适合
低延迟多语种语音转写 / 实时多语言语音代理
不适合
未微调的适配语种直接使用
规模
600M · 未知
授权
NVIDIA Open Model License · 需自查
框架
nemo / pytorch
可信度
225下载, 102赞, FLEURS 英语 WER 7.91%@1.12s 块, NVIDIA 发布

仅 safetensors · 无 pickle 加载风险

社区实测

600M 参数可本地 CPU/笔记本运行的流式多语言 ASR 模型,社区已成功移植到 Apple Silicon(CoreML INT8/MLX)并验证 WER 与 fp32 基本持平

  • 可在笔记本/CPU 本地运行,无需 GPU
  • 端到端延迟低于 100ms,适合实时流式场景
  • 单模型覆盖 40 个语言-地区变体
  • 社区 Apple Silicon 移植(CoreML INT8/MLX)WER 与 fp32 参考偏差在 ±0.3 个百分点以内
  • 社区 Apple Silicon 移植在 6 种语言中仅 5 种实现 bit-identical WER,存在个别语言差异

截至 2026-06-19

快速上手

nemo_asr.models.ASRModel.from_pretrained('nvidia/nemotron-3.5-asr-streaming-0.6b')