togethercomputer / RedPajama-Data-V2
基于84个CommonCrawl快照的百亿级多语言预训练语料,含质量信号与去重ID
下载 6.9k · 收藏 403 · 1年前更新
- 原始规模超过100B文档、100万亿tokens,覆盖5种主要欧洲语言
- 为30B文档提供了40+种预计算质量信号,支持按需过滤与加权
- 附带重复文档ID列表,可构建20B去重子集
为什么值得用作为公开可复现的大规模Web语料基座,配合质量信号可定制训练数据,适合需要灵活过滤与研究的团队
- 去重需自行利用提供的ID进行,HuggingFace加载的版本未做去重
- 数据来源为网络爬虫,存在领域偏差、内容重复及低质页面
- 质量信号虽丰富,但最优过滤规则取决于下游任务,没有通用方案
- 文档来自HTML转换,可能包含导航文本、广告等噪声,需额外清理
- 许可证标注为‘unknown’,使用前需自行评估版权与合规风险
- 原始数据未经清洗,直接用于训练会产生HTML伪影、低质内容等问题
- 完整下载需大量存储空间与带宽(数百TB级)