指南 / 视频生成模型
视频生成模型
共 7 个 · 数据更新于 2026-07-08
显存档为包含式:更低显存也能跑的模型一并计入。数值取 Q4 量化后估算。
| 模型 | 参数量 | 显存门槛 | 上下文 | 许可证 | 商用 | 语言 | 国内可达 | 部署 |
|---|---|---|---|---|---|---|---|---|
| LTX-Best-Face-ID (Alissonerdx) LoRA · 基于 LTX-2.3 | 22B (基模型) | Q4 ~15GB / FP16 ~53GB | — | other | 需自查 | — | 需代理 | — |
| JoyAI-Echo (JD) | — | — | — | LTX-2 Community License (研究/非商用) | 需自查 | — | 需代理 | huggingface-cli download google/gemma-3-12b-it --local-dir checkpoints/gemma-3-12b/ && python inference.py 等 3 种 |
| NAVA-6.3B (Baidu) 微调自 Wan2.2-TI2V-5B | 6.3B | — | — | Apache-2.0 | 可商用 | — | 需代理 | git clone https://github.com/ernie-research/NAVA && cd NAVA && huggingface-cli download baidu/NAVA --local-dir . 等 2 种 |
| NAVA (Baidu) 微调自 Wan2.2-TI2V-5B | 6.3B | — | 文本 512 tokens · 最大 10 秒视频 | apache-2.0 | 可商用 | — | 需代理 | Gradio Web UI: bash gradio_demo/start_gradio.sh 等 2 种 |
| LTX-2.3-Workflows (RuneXX) | — | — | — | — | — | — | 需代理 | git clone https://huggingface.co/RuneXX/LTX-2.3-Workflows |
| LTX2.3-10Eros-GGUF (vantagewithai) 量化自 LTX2.3-10Eros | — | — | — | — | — | — | 需代理 | git clone https://github.com/TenStrip/10S-Comfy-nodes custom_nodes/ |
| Sulphur-2-base (SulphurAI) 量化自 LTX-2.3 原生 · GGUF | 22B | — | — | other | — | — | 需代理 | diffusers.from_pretrained('SulphurAI/Sulphur-2-base') 等 2 种 |
没有同时满足所选条件的模型,试着去掉一个筛选。
常见坑
- 模型仅在近照人脸裁剪上训练,未见过人物实际衣着或身体,衣着和身体部分依赖模型猜测 —— Alissonerdx/LTX-Best-Face-ID
- 模型体积巨大:权重约 46GB,完整管线约 70GB,对消费级硬件极不友好 — Reddit 指出 46GB,YouTube 指出 70GB pipeline —— jdopensource/JoyAI-Echo
- 本质是 LTX-2.3 的大规模微调,并非全新架构 — Reddit 明确标注为 LTX-2.3 finetune —— jdopensource/JoyAI-Echo
- 峰值显存需求 80 GB,消费级显卡无法运行(来源 1) —— baidu/NAVA
- 推理前必须用内置 rewriter 将简短描述改写为长段落分镜提示词,否则效果不佳(来源 1) —— baidu/NAVA
- LTX 2.3 在快速运动场景下会出现模糊和角色涂抹 —— RuneXX/LTX-2.3-Workflows
- 生成的动作可能僵硬、不自然,缺乏力度 —— RuneXX/LTX-2.3-Workflows
- ComfyUI 内置的默认 LTX 工作流效果明显差于官方版本 —— RuneXX/LTX-2.3-Workflows
展开其余 10 条
- 文本生视频提示词遵循度差,无法用于专业工作流 —— vantagewithai/LTX2.3-10Eros-GGUF
- 存在严重过拟合问题,生成内容中会反复出现训练数据中的 Logo(如 TED、Washington Post 等) —— vantagewithai/LTX2.3-10Eros-GGUF
- 图像生视频功能基本不可用,LoRA 训练效果差,角色一致性无法保证 —— vantagewithai/LTX2.3-10Eros-GGUF
- ComfyUI 本地版效果不如桌面端/API 版本,存在 API 付费墙功能差异的嫌疑 —— vantagewithai/LTX2.3-10Eros-GGUF
- 模型发布时间极短(2026 年 5 月初),缺乏数月的真实场景压力测试 —— SulphurAI/Sulphur-2-base
- 与同期竞品 10Eros 相比,后者在图像到视频的人脸一致性上表现更好 —— SulphurAI/Sulphur-2-base
- 基座模型已内置 LoRA,官方建议不要同时加载基座和额外 LoRA,否则可能冲突 —— SulphurAI/Sulphur-2-base
- 8GB 显卡生成 512×512、3 秒视频单次耗时约 5-8 分钟,速度不算快 —— SulphurAI/Sulphur-2-base
- 整体画质仍不及 Sora、Veo 等闭源旗舰产品 —— SulphurAI/Sulphur-2-base
- "无审查"意味着内容合规责任完全落在本地用户身上,技术上可行不代表法律上无风险 —— SulphurAI/Sulphur-2-base