JoyAI-Echo (JD)
分钟级多镜头音视频长视频生成,面向研究者
仓库标识jdopensource/JoyAI-Echo
许可 需自查任务 视频生成最近核对 2026-08-05
链接指向的配置 不在本页收录的形态里,已显示默认形态(原生)。
- 运行时
- 原生 PyTorch
- 下载
- 1,424
适合与不适合
独立证据与社区反馈
京东开源的基于 LTX-2 的长视频生成模型,主打多镜头音视频联合生成,因模型体积大(46GB)且显存要求高(峰值约39GB),社区适配仍处于早期阶段
- 分钟级多镜头长视频生成,跨镜头角色外观与声音保持一致性
- 视频与音频联合生成,无需后续配音
- 通过 DMD 蒸馏实现 7.5× 推理加速
- 模型体积大(46GB),单卡 B200 峰值显存约 39GB,消费级硬件难以运行
- vllm-omni 集成尚不完全(Attention 未接入、小画布 warmup 未启用),生产可用性待验证
- 仅限学术研究与非商业用途
- 独立评测China Just Released the Ultimate Open Source AI Video Monster!
- 社区实测JoyAI-Echo video model released on HF : r/StableDiffusion
- 转载/仓库[RFC]: Add JoyAI-Echo (LTX-2.3-derived multi-shot T2V+Audio) · Issue #4193 · vllm-project/vllm-omni · GitHub
- 官方/厂商jdopensource/JoyAI-Echo · Hugging Face
可信度1424 下载,长视频人类评估视觉美学偏好率 63.6% vs HappyOyster 27.6%
完整规格
下载动量
30天下载 17.2k → 1.6k · likes +7