数据集 / togethercomputer / RedPajama-Data-V2

togethercomputer / RedPajama-Data-V2

基于84个CommonCrawl快照的百亿级多语言预训练语料,含质量信号与去重ID

HF 源仓库 ↗本站资料更新 2026-06-21

关键规格

作者
togethercomputer
规模
138.2 GB
模态
文本
任务
文本生成
语种
en / de / fr / es / it
HF 热度6,903 下载 · 403 收藏观测于 2026-06-21
源仓库更新2024-11-21

编辑部补充

为什么值得关注

作为公开可复现的大规模Web语料基座,配合质量信号可定制训练数据,适合需要灵活过滤与研究的团队

主要亮点

  • 原始规模超过100B文档、100万亿tokens,覆盖5种主要欧洲语言
  • 为30B文档提供了40+种预计算质量信号,支持按需过滤与加权
  • 附带重复文档ID列表,可构建20B去重子集

数据质量

  • 去重需自行利用提供的ID进行,HuggingFace加载的版本未做去重
  • 数据来源为网络爬虫,存在领域偏差、内容重复及低质页面
  • 质量信号虽丰富,但最优过滤规则取决于下游任务,没有通用方案
  • 文档来自HTML转换,可能包含导航文本、广告等噪声,需额外清理

限制与取舍

  • 许可证标注为‘unknown’,使用前需自行评估版权与合规风险
  • 原始数据未经清洗,直接用于训练会产生HTML伪影、低质内容等问题
  • 完整下载需大量存储空间与带宽(数百TB级)

采用判断

暂无足够公开证据形成采用判断。

这不代表数据没有风险,采用前仍需核对数据内容、许可、隐私与生成方式。

相关数据集

正式取代关系

历史记录

1 次历史卡片 · 2026-06-21