🎤victor / LongCat-Video-Avatar-1.5
音频驱动说话头视频生成:上传参考图像+音频+文本提示,输出5秒唇形同步视频。基于美团LongCat-Video-Avatar 1.5,INT8量化DiT,DMD2蒸馏8步LoRA,ZeroGPU xlarge运行。
音频驱动说话头视频生成:上传参考图像+音频+文本提示,输出5秒唇形同步视频。基于美团LongCat-Video-Avatar 1.5,INT8量化DiT,DMD2蒸馏8步LoRA,ZeroGPU xlarge运行。
文本到图像生成模型,12B参数rectified flow transformer。由Black Forest Labs开发,权重开源,采用guidance蒸馏训练,非商业许可。
单提示词创建AI漫画。需LLM和SDXL等组件,开源项目但依赖多个外部服务。
文本到图像生成模型,12B参数rectified flow transformer。1-4步生成,使用潜在对抗扩散蒸馏训练,Apache-2.0许可。
零样本语音克隆的非官方demo,基于F5-TTS和E2-TTS(flow matching),输入音频与文本克隆说话人音色。
运行模型 SWivid/F5-TTS
生成高质量幻觉艺术作品,输入文本提示输出图像。
Vibe Coding平台:通过自然语言描述生成应用程序。基于DeepSeek-V3-0324模型,面向开发者和数据科学家。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索