🌳webml-community / bonsai-image-webgpu
在浏览器中运行的三元权重(1.58-bit)文生图扩散变压器,针对Apple Silicon部署,模型大小1.21 GB,相比FP16压缩约6.4倍。
在浏览器中运行的三元权重(1.58-bit)文生图扩散变压器,针对Apple Silicon部署,模型大小1.21 GB,相比FP16压缩约6.4倍。
VGGT-Ω是前馈相机与深度重建模型:输入图像或短视频,输出3D点云及估计相机位姿,由牛津VGG组和Meta AI开发,采用FAIR非商业研究许可。
运行模型 facebook/VGGT-Omega
VoxCPM2 Demo是基于Nano-vLLM后端的Gradio演示空间,用于展示VoxCPM2模型。
Open LLM Leaderboard是一个React前端界面,用于跟踪、排名和评估开源大语言模型,支持可复现的比较。
MusicGen是Meta AI开发的音乐生成模型,属于AudioCraft库,基于PyTorch,可生成高质量音频。
阿里 HumanAIGC 的虚拟试衣 demo,输入人物照与服装图,经两阶段扩散合成对应穿着效果,支持多体型与姿态。
Whisper 的 JAX 实现,借助 TPU 与批处理大幅提升长音频转写吞吐,相较原版 PyTorch 推理快数十倍。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索