allenai / dolma
开放语料库,用于语言模型预训练研究
已被后续数据集取代 · 查看后继数据集 →
社区实测
Dolma 是当时规模最大的开放预训练语料库,主要服务于 OLMo 模型训练,社区认可其透明度但实际使用中存在工程与合规摩擦。
- 提供可公开获取、可审计的预训练数据,使研究者能间接研究闭源模型的训练数据构成
- 覆盖网页、学术文献、代码、书籍、百科等多领域内容
- 使用 AI2 Impact License 而非标准开放许可
- HuggingFace 讨论区有用户标记法律合规问题
- v1.7 存在重复文档
- 已被 Dolma 3 取代,v1.x 不再是最新版本
- 下载与存储工程门槛高,wget 脚本有覆盖/跳过问题
- 流式访问报错,开箱体验不稳定
来源
Dolma: An Open Corpus of 3 Trillion Tokens for Language Model ...Ai2 Dolma: 3 trillion token open corpus for language model pretrainingOlmo 3: Charting a path through the model flow to lead open-source AIallenai/dolma · Discussions
截至 2026-06-20