allenai / dolma
包含3万亿token的英文语料,用于语言模型预训练研究。
下载 4.8k · 收藏 1.0k · 2年前更新
社区实测
社区认可其作为当时最大规模开放预训练语料的研究价值,但 AI2 Impact License 并非标准开放许可,实际开放性存在争议
- 提供了可公开获取的大规模预训练语料,使研究者能间接研究甚至审查闭源模型的训练数据构成
- 提供多版本发布(v1.5/v1.7),支持训练可复现性
- 采用 AI2 Impact License 而非标准开放许可(如 CC),商用存在限制
- v1.7 版本(4.5TB)相比 v1.5(6.4TB)数据量大幅缩减,部分数据被移除
Ai2 Dolma: 3 trillion token open corpus for language model pretraining | Ai2[PDF] Dolma: An Open Corpus of 3 Trillion Tokens for Language Model ...allenai/dolma · Datasets at Hugging Face
截至 2026-06-20