🏆baidu / Unlimited-OCR
百度推出的OCR模型,基于Transformer架构,支持单页与多页文档图片的文字识别与解析,输出结构化的文档内容。
运行模型 baidu/Unlimited-OCR
百度推出的OCR模型,基于Transformer架构,支持单页与多页文档图片的文字识别与解析,输出结构化的文档内容。
运行模型 baidu/Unlimited-OCR
Google DeepMind Gemma 4模型(多模态、256K上下文、支持140+语言)推理速度挑战排行榜,展示参赛者在固定GPU上的TPS与PPL。
VoxCPM2语音模型的Gradio演示,基于Nano-vLLM推理引擎,提供实验性推理接口。
基于LTX 2.3音频-视频模型的图生视频演示,支持同时生成音频,输出带声音的MP4,提供人脸定位模式。
开源LLM排行榜的前后端应用,用于跟踪、排名和评估大型语言模型与聊天机器人的性能。
Meta推出的音乐生成模型MusicGen(AudioCraft库),基于Transformer/PyTorch,从文本或旋律生成高质量音频。
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索