模型 / Nemotron-Labs-Audex-2B (NVIDIA)

Nemotron-Labs-Audex-2B (NVIDIA)

统一音频-文本语言模型,支持语音识别、翻译、TTS 与音频生成

作者 nvidia

仓库标识nvidia/Nemotron-Labs-Audex-2B

显存未知许可 需自查任务 文本生成最近核对 2026-08-05
运行内存
权重格式未知,无法估算显存
运行时
vllm
下载
1,050

Hugging Face 源仓库 ↗

适合与不适合

入选理由
统一音频文本的多任务模型,支持理解、识别、翻译、TTS和音频生成,128K上下文,需自建vLLM环境且仅限非商业使用。
适合
语音识别与翻译、音频问答 / 文本转语音、音频生成
不适合
商业用途 (非商用许可)

独立证据与社区反馈

1 个独立来源 · 另 1 官方/转载最近验证 2026-08-05

独立来源不足,尚未形成社区共识:社区实测有限;有用户反馈推理速度尚可(M4 Pro 上约 90 tokens/s),但文本推理质量不佳、存在明显幻觉,不适合作为 coding agent 使用

  • 在消费级硬件上(M4 Pro)推理速度可达到约 90 tokens/s,响应延迟可接受
  • 文本推理容易产生幻觉,在代码分析任务中表现不佳
  • 发布首日部分资源链接(SFT 数据集)404 失效
  • 使用 XCodec2 解码音频可获得更好质量但无法流式输出

可信度NVIDIA 发布,技术报告 arXiv:2607.05196,兼容 vLLM 与 transformers

完整规格

规模
2B · 128k · 权重格式未知,无法估算显存
授权
NVIDIA OneWay Noncommercial License · 需自查
框架
vllm / transformers
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 1.3k → 1.4k · likes +2

观测时间线