💬nvidia / LocateAnything
输入图像或视频与自然语言描述,定位其中任意物体,基于论文arxiv.org/abs/2605.27365。
收藏 404 · 3个月前更新
本页记录当日收录项目;运行状态与体验入口按当前结果更新。完整目录见 Space 体验目录。
输入图像或视频与自然语言描述,定位其中任意物体,基于论文arxiv.org/abs/2605.27365。
该演示对应 Omni-Video-Factory,属于视频生成/编辑工具,支持文本生成视频、图像生成视频以及视频延长三类输入输出。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索