🎨multimodalart / z-image-6b-pixel-space
基于L2P迁移范式的6B参数像素空间扩散模型,无需VAE,支持1K分辨率图像生成,利用预训练潜在扩散模型知识。
运行模型 zhen-nan/L2P
基于L2P迁移范式的6B参数像素空间扩散模型,无需VAE,支持1K分辨率图像生成,利用预训练潜在扩散模型知识。
运行模型 zhen-nan/L2P
Omni-Blink LoRA 演示demo
美团LongCat视频人像模型1.5,输入参考图像、音频和文本提示,输出5秒唇形同步视频,采用INT8量化DiT和DMD2蒸馏8步LoRA。
输入一个提示词,自动生成AI漫画,开源项目,需要多种组件(前端、后端、LLM、SDXL等)协同运行。
Black Forest Labs 推出的 12B 参数 rectified flow Transformer 文本到图像模型,dev 为指导蒸馏的非商用开源权重,画质与提示词跟随对标当下闭源 SOTA。
F5-TTS与E2-TTS零样本语音克隆的非官方演示,输入参考音频和文本,合成克隆语音。附带Vocos神经声码器。
FLUX.1 家族的快速版,1–4 步采样即可出图,Apache-2.0 开源可商用,面向低延迟实时生成。
IllusionDiffusion 是在 Stable Diffusion 上结合 ControlNet 条件扩展的图像生成流程,能把输入的文字和图案/图片嵌进几何或纹理结构中,生成近看是正常画面、远看或眯眼会显露隐藏图像的可控光学错觉作品。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索