数据集 / allenai / olmOCR-bench

allenai / olmOCR-bench

包含1403个PDF文件和7010个测试用例,评估OCR系统转换PDF为markdown的能力。

HF 源仓库 ↗本站资料更新 2026-06-25

关键规格

作者
allenai
规模
439 MB
模态
文本
授权
odc-by · 许可标注允许商用
语种
en
HF 热度5,929 下载 · 243 收藏观测于 2026-06-25
源仓库更新2026-02-19

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

采用判断

项目资料与外部反馈 · 4 个来源 · 核验于 2026-07-22

该基准面向英文数字印刷文档,数据集许可附带研究与教育用途限制;单位测试同时用于训练监督与评分,存在过拟合与分数膨胀风险;社区指其对比方法有缺陷。[1][2][3]

适合用来

  • 评估英文数字印刷文档的OCR质量[1][3]

采用前注意

  • 数据集许可为ODC-BY-1.0,附带AI2负责任使用指南,限定研究与教育用途[1]
  • 社区反馈指该基准的对比方法存在缺陷,对marker产品的评估结果不可靠[2]
  • 官方论文明确指出单位测试既用于训练监督又用于评分,模型可能针对测试过度优化[3]
  • 官方确认使用合成文档管线生成训练数据,合成数据占比不透明[3][4]
  • 官方明确限定为英文数字印刷文档,不含手写、非英语或多语种场景[3]

历史记录

1 次历史卡片 · 2026-06-25