模型 / JoyAI-Echo (JD)

JoyAI-Echo (JD)

分钟级多镜头音视频长视频生成,面向研究者

作者
jdopensource
对位
对位 HappyOyster (Directing) / Wan 2.6
适合
长视频多镜头故事创作(含音频) / 交互式实时视频编辑
不适合
图像到视频生成(I2V 未支持)
入选理由
开源长视频生成模型,支持5分钟多镜头视频+音频联合生成,需46GB+显存自部署,适合研究或高端用户探索一致性强、可交互的长视频生成。
授权
LTX-2 Community License (研究/非商用) · 需自查
框架
原生 PyTorch
视频
文生 · 46-50GB 显存 · 最长5分钟 · 1280x736
国内访问
需代理
可信度
1424 下载,长视频人类评估视觉美学偏好率 63.6% vs HappyOyster 27.6%

社区实测

首个开源 5 分钟级长视频模型,角色/声音一致性表现亮眼,但模型体量巨大(46–70GB),本地跑起来门槛很高。

  • 开源长视频生成,单次可产出最长约 5 分钟的视频 — YouTube 实测 walkthrough 验证了该能力
  • 多镜头间角色外观与声音保持一致性,减少身份漂移 — YouTube 评测与项目页均强调此点
  • 可在本地部署运行(需足够显存),权重已上 Hugging Face — Reddit 与 YouTube 均提及本地部署与 HF 发布
  • 模型体积巨大:权重约 46GB,完整管线约 70GB,对消费级硬件极不友好 — Reddit 指出 46GB,YouTube 指出 70GB pipeline
  • 本质是 LTX-2.3 的大规模微调,并非全新架构 — Reddit 明确标注为 LTX-2.3 finetune

截至 2026-06-21

国内 需代理 · 1,424 下载

仅 safetensors · 无 pickle 加载风险

快速上手

huggingface-cli download google/gemma-3-12b-it --local-dir checkpoints/gemma-3-12b/ && python inference.py

本形态源 ↗

下载动量

30天下载 8k → 7.1k · likes +19

观测时间线