🎤victor / LongCat-Video-Avatar-1.5
音频驱动说话头视频生成:上传参考图像+音频+文本提示,输出5秒唇形同步视频。基于美团LongCat-Video-Avatar 1.5,INT8量化DiT,DMD2蒸馏8步LoRA,ZeroGPU xlarge运行。
2026-06-09
音频驱动说话头视频生成:上传参考图像+音频+文本提示,输出5秒唇形同步视频。基于美团LongCat-Video-Avatar 1.5,INT8量化DiT,DMD2蒸馏8步LoRA,ZeroGPU xlarge运行。
文本到图像生成模型,12B参数rectified flow transformer。由Black Forest Labs开发,权重开源,采用guidance蒸馏训练,非商业许可。