🌳webml-community / bonsai-image-webgpu
基于三元权重(1.58-bit)的文本到图像扩散Transformer,在浏览器中运行,支持Apple Silicon,模型大小为1.21GB(相对FP16压缩6.4倍)。
基于三元权重(1.58-bit)的文本到图像扩散Transformer,在浏览器中运行,支持Apple Silicon,模型大小为1.21GB(相对FP16压缩6.4倍)。
Gemma效率挑战赛的监控面板,展示队伍在固定GPU上对google/gemma-4-E4B-it模型的推理速度(TPS)和质量(PPL)排名。
VoxCPM2语音模型的Gradio演示,使用Nano-vLLM后端进行推理。
MOSS-TTS v1.5文本到语音模型,支持零样本声音克隆、长文本生成、多语言(31种语言)及拼音/IPA发音控制。
实时音乐生成Demo,通过MIDI键盘输入音符,驱动Magenta RealTime 2模型生成音乐,基于PyTorch。
开放LLM排行榜的前后端应用,用于跟踪、排名和比较开源大语言模型(LLMs)的评估结果。
Facebook的AudioCraft库演示,包含MusicGen和AudioGen模型,用于生成高质量音频(音乐/声音),基于PyTorch。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索