此页是 2026-06-06 的观测快照,查看该模型当前信息 → /m/jdopensource__joyai-echo/

归档 / 2026-06-06 / JoyAI-Echo (JD)

JoyAI-Echo (JD)

分钟级多镜头音视频长视频生成,面向研究者

入选理由
开源长视频生成模型,支持5分钟多镜头视频+音频联合生成,需46GB+显存自部署,适合研究或高端用户探索一致性强、可交互的长视频生成。
对位
对位 HappyOyster (Directing) / Wan 2.6
适合
长视频多镜头故事创作(含音频) / 交互式实时视频编辑
不适合
图像到视频生成(I2V 未支持)
规模
未公开 · 未知
授权
LTX-2 Community License (研究/非商用) · 需自查
框架
原生 PyTorch
视频
文生 · 46-50GB 显存 · 最长5分钟 · 1280x736
可信度
1424 下载,长视频人类评估视觉美学偏好率 63.6% vs HappyOyster 27.6%

仅 safetensors · 无 pickle 加载风险

社区实测

首个开源 5 分钟级长视频模型,角色/声音一致性表现亮眼,但模型体量巨大(46–70GB),本地跑起来门槛很高。

  • 开源长视频生成,单次可产出最长约 5 分钟的视频 — YouTube 实测 walkthrough 验证了该能力
  • 多镜头间角色外观与声音保持一致性,减少身份漂移 — YouTube 评测与项目页均强调此点
  • 可在本地部署运行(需足够显存),权重已上 Hugging Face — Reddit 与 YouTube 均提及本地部署与 HF 发布
  • 模型体积巨大:权重约 46GB,完整管线约 70GB,对消费级硬件极不友好 — Reddit 指出 46GB,YouTube 指出 70GB pipeline
  • 本质是 LTX-2.3 的大规模微调,并非全新架构 — Reddit 明确标注为 LTX-2.3 finetune

截至 2026-06-21

快速上手

huggingface-cli download google/gemma-3-12b-it --local-dir checkpoints/gemma-3-12b/ && python inference.py

评分详情

Q1
今天能接上用吗   3 / 5
Q2
有可信证据吗   1 / 5
Q3
是新东西吗   5 / 5
总分
9

HuggingFace 原始数据 (抓取于 2026-06-06)

作者
jdopensource
任务类型
text-to-video
推理库
ltx-video
下载
1,424
点赞
69
许可证
LTX-2 Community License (研究/非商用)
标签
ltx-video, JoyAI-Echo, text-to-video, video-generation, audio-video-generation, long-video, multi-shot, dmd, license:other, region:us

探索

源链接