🏆baidu / Unlimited-OCR
基于Transformer的文档解析OCR模型,支持单页和多页PDF/图片输入,输出解析结果,可配置base size等参数。
收藏 299 · 2个月前更新
本页记录当日收录项目;运行状态与体验入口按当前结果更新。完整目录见 Space 体验目录。
基于Transformer的文档解析OCR模型,支持单页和多页PDF/图片输入,输出解析结果,可配置base size等参数。
LTX 2.3图像转视频模型,支持原生音频生成,基于Comfy工作流运行,可控制目标模式。
Google DeepMind Gemma 4模型(多模态、256K上下文、支持140+语言)推理速度挑战排行榜,展示参赛者在固定GPU上的TPS与PPL。
VoxCPM2语音模型的Gradio演示,基于Nano-vLLM推理引擎,提供实验性推理接口。
Open LLM 排行榜:跟踪、排名和评估开放大语言模型与聊天机器人,提供 React 前端、后端 API 与 Docker 容器化部署,用于可复现地对比模型。
阿里 HumanAIGC 的虚拟试衣 demo,输入人物照与服装图,经两阶段扩散合成对应穿着效果,支持多体型与姿态。
Facebook Research 的 AudioCraft 音频生成库,包含 MusicGen 与 AudioGen 两个模型,提供高质量音频生成、训练与推理代码,依赖 Python 3.9 和 PyTorch 2.0。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索