此页是 2026-06-04 的观测快照,查看该模型当前信息 → /m/baidu__nava/

归档 / 2026-06-04 / NAVA-6.3B (Baidu)

NAVA-6.3B (Baidu)

文本/图像生成音视频同步内容,支持多说话人音色控制

入选理由
NAVA以6.3B参数实现视频音频联合生成,新架构有亮点,需自行部署(8GPU+数十GB权重)。
对位
对位 Ovi 1.1 / LTX 2.3 等开源音视频模型
适合
文本/图像生成带同步音频的视频 / 多说话人场景指定音色控制
不适合
单 GPU 实时推理或长于 10 秒视频
规模
6.3B · 未知
授权
Apache-2.0 · 可商用
框架
torch / diffusers
视频
文生 · 1280x704 · 最长10s · 推荐8 GPU
血统
微调自 Wan2.2-TI2V-5B
可信度
VerseBench Sync-C 7.79最高,WER 0.099,Apache-2.0

仅 safetensors · 无 pickle 加载风险

社区实测

官方宣称音画同步达到同类最佳,但社区实际讨论极少,尚难形成口碑共识

  • 联合音视频生成:单一 6.3B 模型同时输出视频与音频(来源 1)
  • Apache 2.0 全栈开源:提供推理/训练代码与 Gradio 演示(来源 1、2)
  • 峰值显存需求 80 GB,消费级显卡无法运行(来源 1)
  • 推理前必须用内置 rewriter 将简短描述改写为长段落分镜提示词,否则效果不佳(来源 1)

截至 2026-06-28

快速上手

git clone https://github.com/ernie-research/NAVA && cd NAVA && huggingface-cli download baidu/NAVA --local-dir .

评分详情

Q1
今天能接上用吗   3 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   5 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-06-04)

作者
baidu
任务类型
text-to-video
推理库
custom
下载
159
点赞
57
许可证
Apache-2.0
标签
custom, ti2v, text-to-video, text-to-audio-video, audio-video-generation, mmdit, flow-matching, wan2.2, en, zh, arxiv:2605.30073, base_model:Wan-AI/Wan2.2-TI2V-5B, base_model:finetune:Wan-AI/Wan2.2-TI2V-5B, license:apache-2.0, region:us

探索

源链接