🐌EldMans / wan2.2_14b_i2v_480p_lightning_nsfw_diffusers
输入图片和文本提示,生成视频。
收藏 187 · 2个月前更新 详情
2026-07-18
输入图片和文本提示,生成视频。
210M参数的编码器模型,从HTML中提取主要内容,单次前向传播标记每个块为内容或模板,速度比0.6B解码器快约20倍(ROUGE-5 F1 0.862)。
输入图片和文本提示,生成对应视频。
基于Qwen3.5骨干和Q-Former的自回归语音合成模型,支持语音克隆和文本CFG控制,使用NeMo nano编解码器将参考音频压缩为8个前缀token。