🏆cinderholm / wan2-2-i2v-v3
收藏 696 · 27天前更新
本页记录当日收录项目;运行状态与体验入口按当前结果更新。完整目录见 Space 体验目录。
MiniMax-H3 的演示:文本等条件经 Qwen3-VL 编码后,由 61.73 GiB Transformer 与双自动编码器单次去噪生成带同步立体声的视频,最高 2K、15 秒;bfloat16 无量化,权重公开。
FLUX.1 [schnell] 的文本生成图像演示:12B 参数 rectified flow Transformer,经潜在对抗扩散蒸馏,1 至 4 步生成图像,Apache-2.0 许可,可商用。
运行模型 black-forest-labs/FLUX.1-schnell ↗
LivePortrait 的官方 PyTorch 实现:将驱动视频中的人脸运动迁移到静态人像上,实现人像动画,具备拼接与重定向控制;仓库提供预训练权重和使用说明。
F5-TTS 与 E2-TTS 的非官方演示:零样本声音克隆,利用 Flow Matching 合成语音;本地需放置对应预训练检查点,相关代码与论文见 GitHub。
运行模型 SWivid/F5-TTS ↗
DALL·E Mini 的演示:根据文本提示生成图像,面向研究与个人使用;其中 DALL·E Mega 是最大版本,可用于创意等下游场景。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索