NAVA-6.3B (Baidu)
文本/图像生成音视频同步内容,支持多说话人音色控制
社区实测
官方宣称音画同步达到同类最佳,但社区实际讨论极少,尚难形成口碑共识
- 联合音视频生成:单一 6.3B 模型同时输出视频与音频(来源 1)
- Apache 2.0 全栈开源:提供推理/训练代码与 Gradio 演示(来源 1、2)
- 峰值显存需求 80 GB,消费级显卡无法运行(来源 1)
- 推理前必须用内置 rewriter 将简短描述改写为长段落分镜提示词,否则效果不佳(来源 1)
截至 2026-06-28
本形态 ~3.8GB 4-bit · 国内 需代理 · 159 下载
仅 safetensors · 无 pickle 加载风险
快速上手
git clone https://github.com/ernie-research/NAVA && cd NAVA && huggingface-cli download baidu/NAVA --local-dir . 下载动量
30天下载 216 → 105 · likes +3
观测时间线
模型家族
- Wan2.2-TI2V-5B
- 微调 NAVA (Baidu)
- 微调 NAVA-6.3B (Baidu)