💬nvidia / LocateAnything
英伟达官方演示,输入自然语言描述,可在图像或视频中定位任意物体,基于论文 arXiv 2605.27365。
收藏 258 · 1个月前更新 详情
英伟达官方演示,输入自然语言描述,可在图像或视频中定位任意物体,基于论文 arXiv 2605.27365。
文本转视频、图像转视频、视频扩展演示,支持多种视频生成方式。
无审查通用智能排行榜,用于评估模型的通用能力。
扩散语言模型代码生成演示,输入网站描述,实时生成自包含 HTML 文档,支持编辑和实时预览,采用 DiffusionGemma 架构。
输入图片和文本提示生成视频,图像到视频生成任务。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索