🍲multimodalart / MisoTTS
文本转语音与声音克隆,8B参数,基于Sesame CSM架构,使用Llama 3.2风格骨干和自回归音频解码器,生成Mimi音频码。
运行模型 MisoLabs/MisoTTS →
收藏 19 · 3个月前更新
本页记录当日收录项目;运行状态与体验入口按当前结果更新。完整目录见 Space 体验目录。
文本转语音与声音克隆,8B参数,基于Sesame CSM架构,使用Llama 3.2风格骨干和自回归音频解码器,生成Mimi音频码。
运行模型 MisoLabs/MisoTTS →
图片转视频,支持原生音频生成,基于LTX 2.3 audio-video模型和fp8 checkpoint,运行Comfy工作流,可关闭音频输出静音MP4。
Kokoro-TTS 的演示空间,已升级至 v1.0,提供文本转语音(TTS)的在线生成能力。
运行模型 hexgrad/Kokoro-82M →
图像抠图去背景 demo,基于 BRIA RMBG 分割模型一键分离前景主体并输出透明背景。
运行模型 briaai/RMBG-2.0 ↗
快手 Kolors 团队的虚拟试衣 demo,上传人物与服装图即可生成上身效果,底层基于 Kolors 扩散模型。
运行模型 Kwai-Kolors/Kolors ↗
LMArena(原 LMSYS Chatbot Arena)的大模型匿名对战排行榜,由众包 pairwise 投票按 Elo / Bradley–Terry 为主流开闭源模型排名。
腾讯推出的文本/图像到 3D 资产生成系统,包含形状生成模型 Hunyuan3D-DiT 与纹理合成模型 Hunyuan3D-Paint,基于扩散 Transformer。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索