SummFlow 2026-07-09 Hugging Face

Nemotron-Labs-Audex-30B-A3B (NVIDIA)

音频-文本统一LLM,兼顾文本推理与语音/音频生成

入选理由
统一音频-文本MoE模型,支持理解、识别、翻译、生成及语音交互,需vLLM和多卡推理。适合有算力的开发者。
对位
对位 3B级稠密模型(如Qwen2.5-3B)
适合
音频理解、语音识别与翻译 / 文本-语音/音频生成与对话
不适合
商业部署(非商业许可)
规模
30B MoE (3B激活) · 1M · Q4 ~20GB / FP16 ~72GB
授权
NVIDIA Oneway Noncommercial License · 需自查
框架
vllm / transformers
可信度
NVIDIA发布,技术报告arXiv:2607.05196,提供vLLM/HF推理脚本及复现步骤

快速上手

python -c "from transformers import AutoModelForCausalLM; AutoModelForCausalLM.from_pretrained('nvidia/Nemotron-Labs-Audex-30B-A3B', trust_remote_code=True)"