togethercomputer / RedPajama-Data-1T
完全开源的LLaMa数据集复现(RedPajama)。
已被后续数据集取代 · 查看后继数据集 →
社区实测
RedPajama-1T是LLaMA训练数据配方的早期开源复现,已被RedPajama-V2取代
- 原始web数据存在HTML转文本伪影、低质量来源和内容偏差,不宜直接用于LLM训练
- 已被RedPajama-V2取代,v2提供30T token、40+预计算质量标注和去重,RPv1代码已归档至rp_v1分支
来源
RedPajama-Data-v2: An open dataset with 30 trillion tokens for training large language modelsGitHub - togethercomputer/RedPajama-Data: The RedPajama-Data repository contains code for preparing large datasets for training large language models. · GitHub
截至 2026-06-20
- pyfrom datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T")