🍲multimodalart / MisoTTS
文本转语音与声音克隆,8B参数,基于Sesame CSM架构,使用Llama 3.2风格骨干和自回归音频解码器,生成Mimi音频码。
运行模型 MisoLabs/MisoTTS
文本转语音与声音克隆,8B参数,基于Sesame CSM架构,使用Llama 3.2风格骨干和自回归音频解码器,生成Mimi音频码。
运行模型 MisoLabs/MisoTTS
图片转视频,支持原生音频生成,基于LTX 2.3 audio-video模型和fp8 checkpoint,运行Comfy工作流,可关闭音频输出静音MP4。
Kokoro文本转语音demo,已升级至v1.0版本。
文本或图片生成高分辨率纹理3D资产,包含Hunyuan3D-DiT形状生成模型(flow-based扩散Transformer)和Hunyuan3D-Paint纹理合成模型。
运行模型 tencent/Hunyuan3D-2
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索