此页是 2026-06-05 的观测快照,查看该模型当前信息 → /m/nvidia__nemotron-35-asr-streaming-06b/

归档 / 2026-06-05 / Nemotron-3.5-ASR-Streaming-0.6B (NVIDIA)

Nemotron-3.5-ASR-Streaming-0.6B (NVIDIA)

覆盖40种语言的流式ASR,600M,可调延迟,面向实时语音代理

入选理由
多语言流式ASR模型,支持40语种和自动语言检测,缓存感知架构,需NeMo环境部署。
对位
替代 Parakeet-RNNT-1.1B 多语言 ASR
适合
低延迟多语种语音转写 / 实时多语言语音代理
不适合
未微调的适配语种直接使用
规模
600M · 未知
授权
NVIDIA Open Model License · 需自查
框架
nemo / pytorch
可信度
225下载, 102赞, FLEURS 英语 WER 7.91%@1.12s 块, NVIDIA 发布

仅 safetensors · 无 pickle 加载风险

社区实测

600M 参数可本地 CPU/笔记本运行的流式多语言 ASR 模型,社区已成功移植到 Apple Silicon(CoreML INT8/MLX)并验证 WER 与 fp32 基本持平

  • 可在笔记本/CPU 本地运行,无需 GPU
  • 端到端延迟低于 100ms,适合实时流式场景
  • 单模型覆盖 40 个语言-地区变体
  • 社区 Apple Silicon 移植(CoreML INT8/MLX)WER 与 fp32 参考偏差在 ±0.3 个百分点以内
  • 社区 Apple Silicon 移植在 6 种语言中仅 5 种实现 bit-identical WER,存在个别语言差异

截至 2026-06-19

快速上手

nemo_asr.models.ASRModel.from_pretrained('nvidia/nemotron-3.5-asr-streaming-0.6b')

评分详情

Q1
今天能接上用吗   3 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   3 / 5
总分
7

HuggingFace 原始数据 (抓取于 2026-06-05)

作者
nvidia
任务类型
automatic-speech-recognition
推理库
nemo
下载
225
点赞
102
许可证
NVIDIA Open Model License
标签
nemo, speech-recognition, cache-aware ASR, automatic-speech-recognition, streaming-asr, multilingual, speech, audio, FastConformer, RNNT, Parakeet, ASR, pytorch, NeMo, en, es, de, fr, it, ar, ja, ko, pt, ru, hi, zh, vi, he, nl, cs, da, pl, no, sv, th, tr, bg, el, et, fi, hr, hu, lt, lv, ro, sk, uk, mt, sl, dataset:nvidia/Granary, dataset:multilingual_librispeech, dataset:fleurs, dataset:mozilla-foundation/common_voice_8_0, dataset:voxpopuli, dataset:europarl, arxiv:2312.17279, arxiv:2305.05084, license:other, model-index, region:us

探索

源链接