数据集 / allenai / dolma

allenai / dolma

开放语料库,用于语言模型预训练研究

已被后继数据集取代 · Dolma 3 Dolmino →Dolma v1 已被 Dolma 3 Dolmino 取代,后者是 OLMo 3 第二阶段退火训练使用的高质量数据池。

HF 源仓库 ↗本站资料更新 2026-08-22

关键规格

作者
allenai
规模
6.1 TB
模态
文本
任务
文本生成
授权
odc-by · 许可标注允许商用
语种
en
HF 热度2,468 下载 · 1,070 收藏观测于 2026-08-22
源仓库更新2024-04-17

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

采用判断

项目资料与外部反馈 · 4 个来源 · 核验于 2026-06-20

Dolma 是当时规模最大的开放预训练语料库,主要服务于 OLMo 模型训练,社区认可其透明度但实际使用中存在工程与合规摩擦。

适合用来

  • 提供可公开获取、可审计的预训练数据,使研究者能间接研究闭源模型的训练数据构成
  • 覆盖网页、学术文献、代码、书籍、百科等多领域内容

采用前注意

  • 使用 AI2 Impact License 而非标准开放许可
  • HuggingFace 讨论区有用户标记法律合规问题
  • v1.7 存在重复文档
  • 已被 Dolma 3 取代,v1.x 不再是最新版本
  • 下载与存储工程门槛高,wget 脚本有覆盖/跳过问题
  • 流式访问报错,开箱体验不稳定

历史记录

7 次历史卡片 · 2026-05-24 至 2026-08-22

研究依据

以下论文与本条目存在经人工复核的直接关系。论文本身不构成对它的推荐。