JoyAI-Echo (JD)
分钟级多镜头音视频长视频生成,面向研究者
社区实测
首个开源 5 分钟级长视频模型,角色/声音一致性表现亮眼,但模型体量巨大(46–70GB),本地跑起来门槛很高。
- 开源长视频生成,单次可产出最长约 5 分钟的视频 — YouTube 实测 walkthrough 验证了该能力
- 多镜头间角色外观与声音保持一致性,减少身份漂移 — YouTube 评测与项目页均强调此点
- 可在本地部署运行(需足够显存),权重已上 Hugging Face — Reddit 与 YouTube 均提及本地部署与 HF 发布
- 模型体积巨大:权重约 46GB,完整管线约 70GB,对消费级硬件极不友好 — Reddit 指出 46GB,YouTube 指出 70GB pipeline
- 本质是 LTX-2.3 的大规模微调,并非全新架构 — Reddit 明确标注为 LTX-2.3 finetune
来源
JoyAI-Echo : Generate 5 minutes long AI video with this free modelChina Just Released the Ultimate Open Source AI Video Monster!JoyAI-Echo video model released on HF : r/StableDiffusion - RedditJoyAI-Echo - Large Scale LTX-2.3 finetune for long form ... - Reddit
截至 2026-06-21
国内 需代理 · 1,424 下载
仅 safetensors · 无 pickle 加载风险
快速上手
huggingface-cli download google/gemma-3-12b-it --local-dir checkpoints/gemma-3-12b/ && python inference.py 下载动量
30天下载 8k → 7.1k · likes +19