togethercomputer / RedPajama-Data-1T
遵循LLaMA数据集格式的开源文本数据
下载 2.4k · 收藏 1.2k · 2年前更新
社区实测
RedPajama-1T是LLaMA训练数据配方的早期开源复现,已被RedPajama-V2取代
- 原始web数据存在HTML转文本伪影、低质量来源和内容偏差,不宜直接用于LLM训练
- 已被RedPajama-V2取代,v2提供30T token、40+预计算质量标注和去重,RPv1代码已归档至rp_v1分支
来源
RedPajama-Data-v2: An open dataset with 30 trillion tokens for training large language modelsGitHub - togethercomputer/RedPajama-Data: The RedPajama-Data repository contains code for preparing large datasets for training large language models. · GitHub
截至 2026-06-20
已被取代 RedPajama-Data-V2 · V2 将规模从 1.2T 扩展到 30T tokens,覆盖 84 个 CommonCrawl 快照,是官方推荐的后续版本
- py from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T")