NAVA-6.3B (Baidu)
文本/图像生成音视频同步内容,支持多说话人音色控制
仅 safetensors · 无 pickle 加载风险
社区实测
官方宣称音画同步达到同类最佳,但社区实际讨论极少,尚难形成口碑共识
- 联合音视频生成:单一 6.3B 模型同时输出视频与音频(来源 1)
- Apache 2.0 全栈开源:提供推理/训练代码与 Gradio 演示(来源 1、2)
- 峰值显存需求 80 GB,消费级显卡无法运行(来源 1)
- 推理前必须用内置 rewriter 将简短描述改写为长段落分镜提示词,否则效果不佳(来源 1)
截至 2026-06-28
快速上手
git clone https://github.com/ernie-research/NAVA && cd NAVA && huggingface-cli download baidu/NAVA --local-dir .