allenai / dolma
用于语言模型预训练研究的大规模英文开放语料库
下载 4.4k · 收藏 1.0k · 2年前更新
社区实测
Dolma 是当时规模最大的开放预训练语料库,主要服务于 OLMo 模型训练,社区认可其透明度但实际使用中存在工程与合规摩擦。
- 提供可公开获取、可审计的预训练数据,使研究者能间接研究闭源模型的训练数据构成
- 覆盖网页、学术文献、代码、书籍、百科等多领域内容
- 使用 AI2 Impact License 而非标准开放许可
- HuggingFace 讨论区有用户标记法律合规问题
- v1.7 存在重复文档
- 已被 Dolma 3 取代,v1.x 不再是最新版本
- 下载与存储工程门槛高,wget 脚本有覆盖/跳过问题
- 流式访问报错,开箱体验不稳定
来源
Dolma: An Open Corpus of 3 Trillion Tokens for Language Model ...Ai2 Dolma: 3 trillion token open corpus for language model pretrainingOlmo 3: Charting a path through the model flow to lead open-source AIallenai/dolma · Discussions
截至 2026-06-20
已被取代 Dolma 3 Dolmino · Dolma v1 已被 Dolma 3 Dolmino 取代,后者是 OLMo 3 第二阶段退火训练使用的高质量数据池。