此页是 2026-06-04 的观测快照,查看该模型当前信息 → /m/baidu__nava/
归档 / 2026-06-04 / NAVA-6.3B (Baidu)
NAVA-6.3B (Baidu)
文本/图像生成音视频同步内容,支持多说话人音色控制
- 入选理由
- NAVA以6.3B参数实现视频音频联合生成,新架构有亮点,需自行部署(8GPU+数十GB权重)。
- 对位
- 对位 Ovi 1.1 / LTX 2.3 等开源音视频模型
- 适合
- 文本/图像生成带同步音频的视频 / 多说话人场景指定音色控制
- 不适合
- 单 GPU 实时推理或长于 10 秒视频
- 规模
- 6.3B · 未知
- 授权
- Apache-2.0 · 可商用
- 框架
- torch / diffusers
- 视频
- 文生 · 1280x704 · 最长10s · 推荐8 GPU
- 血统
- 微调自 Wan2.2-TI2V-5B
- 可信度
- VerseBench Sync-C 7.79最高,WER 0.099,Apache-2.0
仅 safetensors · 无 pickle 加载风险
快速上手
git clone https://github.com/ernie-research/NAVA && cd NAVA && huggingface-cli download baidu/NAVA --local-dir . 点击复制
评分详情
- Q1
- 今天能接上用吗 3 / 5
- Q2
- 有可信证据吗 1 / 5
- Q3
- 是新东西吗 5 / 5
- 总分
- 9
HuggingFace 原始数据 (抓取于 2026-06-04)
- 作者
- baidu
- 推理库
- custom
- 下载
- 159
- 点赞
- 57
- 许可证
- Apache-2.0
- 标签
- custom, ti2v, text-to-video, text-to-audio-video, audio-video-generation, mmdit, flow-matching, wan2.2, en, zh, arxiv:2605.30073, base_model:Wan-AI/Wan2.2-TI2V-5B, base_model:finetune:Wan-AI/Wan2.2-TI2V-5B, license:apache-2.0, region:us
探索
源链接