数据集 / allenai / dolma

allenai / dolma

开放语料库,用于语言模型预训练研究

已被后续数据集取代 · 查看后继数据集 →

作者
allenai
规模
6.1 TB
任务
文本生成
授权
odc-by · 可商用
语种
en
下载
4,089
收藏
1,052

社区实测

Dolma 是当时规模最大的开放预训练语料库,主要服务于 OLMo 模型训练,社区认可其透明度但实际使用中存在工程与合规摩擦。

  • 提供可公开获取、可审计的预训练数据,使研究者能间接研究闭源模型的训练数据构成
  • 覆盖网页、学术文献、代码、书籍、百科等多领域内容
  • 使用 AI2 Impact License 而非标准开放许可
  • HuggingFace 讨论区有用户标记法律合规问题
  • v1.7 存在重复文档
  • 已被 Dolma 3 取代,v1.x 不再是最新版本
  • 下载与存储工程门槛高,wget 脚本有覆盖/跳过问题
  • 流式访问报错,开箱体验不稳定

截至 2026-06-20

观测时间线