模型 / JoyAI-Echo (JD)

JoyAI-Echo (JD)

分钟级多镜头音视频长视频生成,面向研究者

作者 jdopensource

仓库标识jdopensource/JoyAI-Echo

许可 需自查任务 视频生成最近核对 2026-08-05
运行时
原生 PyTorch
下载
1,424

Hugging Face 源仓库 ↗

适合与不适合

入选理由
开源长视频生成模型,支持5分钟多镜头视频+音频联合生成,需46GB+显存自部署,适合研究或高端用户探索一致性强、可交互的长视频生成。
对位
对位 HappyOyster (Directing) / Wan 2.6
适合
长视频多镜头故事创作(含音频) / 交互式实时视频编辑
不适合
图像到视频生成(I2V 未支持)

独立证据与社区反馈

2 个独立来源 · 另 2 官方/转载最近验证 2026-08-05

京东开源的基于 LTX-2 的长视频生成模型,主打多镜头音视频联合生成,因模型体积大(46GB)且显存要求高(峰值约39GB),社区适配仍处于早期阶段

  • 分钟级多镜头长视频生成,跨镜头角色外观与声音保持一致性
  • 视频与音频联合生成,无需后续配音
  • 通过 DMD 蒸馏实现 7.5× 推理加速
  • 模型体积大(46GB),单卡 B200 峰值显存约 39GB,消费级硬件难以运行
  • vllm-omni 集成尚不完全(Attention 未接入、小画布 warmup 未启用),生产可用性待验证
  • 仅限学术研究与非商业用途

可信度1424 下载,长视频人类评估视觉美学偏好率 63.6% vs HappyOyster 27.6%

完整规格

授权
LTX-2 Community License (研究/非商用) · 需自查
框架
原生 PyTorch
视频
文生 · 46-50GB 显存 · 最长5分钟 · 1280x736
访问提示
Hugging Face 可能需要代理

下载动量

30天下载 17.2k → 1.6k · likes +7

观测时间线