模型 / NAVA-6.3B (Baidu)

NAVA-6.3B (Baidu)

文本/图像生成音视频同步内容,支持多说话人音色控制

作者
baidu
对位
对位 Ovi 1.1 / LTX 2.3 等开源音视频模型
适合
文本/图像生成带同步音频的视频 / 多说话人场景指定音色控制
不适合
单 GPU 实时推理或长于 10 秒视频
入选理由
NAVA以6.3B参数实现视频音频联合生成,新架构有亮点,需自行部署(8GPU+数十GB权重)。
规模
6.3B · 最低 ~3.8GB · 4-bit(估算)
授权
Apache-2.0 · 可商用
框架
torch / diffusers
视频
文生 · 1280x704 · 最长10s · 推荐8 GPU
血统
微调自 Wan2.2-TI2V-5B
国内访问
需代理
可信度
VerseBench Sync-C 7.79最高,WER 0.099,Apache-2.0

社区实测

官方宣称音画同步达到同类最佳,但社区实际讨论极少,尚难形成口碑共识

  • 联合音视频生成:单一 6.3B 模型同时输出视频与音频(来源 1)
  • Apache 2.0 全栈开源:提供推理/训练代码与 Gradio 演示(来源 1、2)
  • 峰值显存需求 80 GB,消费级显卡无法运行(来源 1)
  • 推理前必须用内置 rewriter 将简短描述改写为长段落分镜提示词,否则效果不佳(来源 1)

截至 2026-06-28

本形态 ~3.8GB 4-bit · 国内 需代理 · 159 下载

仅 safetensors · 无 pickle 加载风险

快速上手

git clone https://github.com/ernie-research/NAVA && cd NAVA && huggingface-cli download baidu/NAVA --local-dir .

本形态源 ↗

下载动量

30天下载 216 → 105 · likes +3

观测时间线

模型家族

  • Wan2.2-TI2V-5B

查看全部家族 →