🌳webml-community / bonsai-image-webgpu
基于三元权重(1.58-bit)的文本到图像扩散Transformer,在浏览器中运行,支持Apple Silicon,模型大小为1.21GB(相对FP16压缩6.4倍)。
运行模型 prism-ml/bonsai-image-ternary-4B-mlx-2bit →
本页记录当日收录项目;运行状态与体验入口按当前结果更新。完整目录见 Space 体验目录。
基于三元权重(1.58-bit)的文本到图像扩散Transformer,在浏览器中运行,支持Apple Silicon,模型大小为1.21GB(相对FP16压缩6.4倍)。
运行模型 prism-ml/bonsai-image-ternary-4B-mlx-2bit →
MOSS-TTS v1.5文本到语音模型,支持零样本声音克隆、长文本生成、多语言(31种语言)及拼音/IPA发音控制。
运行模型 OpenMOSS-Team/MOSS-TTS-v1.5 →
实时音乐生成Demo,通过MIDI键盘输入音符,驱动Magenta RealTime 2模型生成音乐,基于PyTorch。
Google DeepMind Gemma 4模型(多模态、256K上下文、支持140+语言)推理速度挑战排行榜,展示参赛者在固定GPU上的TPS与PPL。
VoxCPM2语音模型的Gradio演示,基于Nano-vLLM推理引擎,提供实验性推理接口。
Open LLM 排行榜:跟踪、排名和评估开放大语言模型与聊天机器人,提供 React 前端、后端 API 与 Docker 容器化部署,用于可复现地对比模型。
阿里 HumanAIGC 的虚拟试衣 demo,输入人物照与服装图,经两阶段扩散合成对应穿着效果,支持多体型与姿态。
Facebook Research 的 AudioCraft 音频生成库,包含 MusicGen 与 AudioGen 两个模型,提供高质量音频生成、训练与推理代码,依赖 Python 3.9 和 PyTorch 2.0。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索