🎤victor / LongCat-Video-Avatar-1.5
音频驱动说话头视频生成:上传参考图像+音频+文本提示,输出5秒唇形同步视频。基于美团LongCat-Video-Avatar 1.5,INT8量化DiT,DMD2蒸馏8步LoRA,ZeroGPU xlarge运行。
运行模型 meituan-longcat/LongCat-Video-Avatar-1.5 ↗
本页记录当日收录项目;运行状态与体验入口按当前结果更新。完整目录见 Space 体验目录。
音频驱动说话头视频生成:上传参考图像+音频+文本提示,输出5秒唇形同步视频。基于美团LongCat-Video-Avatar 1.5,INT8量化DiT,DMD2蒸馏8步LoRA,ZeroGPU xlarge运行。
运行模型 meituan-longcat/LongCat-Video-Avatar-1.5 ↗
基于L2P迁移范式的6B参数像素空间扩散模型,无需VAE,支持1K分辨率图像生成,利用预训练潜在扩散模型知识。
运行模型 zhen-nan/L2P ↗
Omni-Blink LoRA 演示demo
FLUX.1 [schnell] 的文本生成图像演示:12B 参数 rectified flow Transformer,经潜在对抗扩散蒸馏,1 至 4 步生成图像,Apache-2.0 许可,可商用。
运行模型 black-forest-labs/FLUX.1-schnell ↗
IllusionDiffusion 是一个图像生成 demo,用于生成高质量的幻觉/视错觉艺术图像。资料未说明具体输入方式与模型细节。
通过单条提示词生成漫画,结合大语言模型与 SDXL 模型进行图像生成,项目开源。
运行模型 HuggingFaceH4/zephyr-7b-beta ↗
Black Forest Labs 开发的 120 亿参数 rectified flow transformer 文本到图像生成模型,开源权重,非商业许可。
运行模型 black-forest-labs/FLUX.1-dev →
F5-TTS 与 E2-TTS 的非官方演示:零样本声音克隆,利用 Flow Matching 合成语音;本地需放置对应预训练检查点,相关代码与论文见 GitHub。
运行模型 SWivid/F5-TTS ↗
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索