SummFlow 2026-05-24 Hugging Face

tiiuae / falcon-refinedweb

从CommonCrawl过滤去重得到的大型英文网页数据集。

9.68亿行 · 1.7 TB

  • 文本
  • 文本生成
  • odc-by · 可商用

下载 22k · 收藏 914 · 3年前更新

社区实测

以 Apache 2.0 许可公开的大规模网页数据集,学术上证明了纯网页数据经过滤去重可超越精选语料,但实际样本质量参差、社区上手门槛高。

  • Apache 2.0 许可,商用友好
  • 证明经严格过滤和去重的纯网页数据训练效果可超越基于 The Pile 等精选语料的模型
  • 公开释放 600B tokens,规模足以支撑大模型预训练和复现
  • 样本中存在大量低质量网页噪音,如博客评论、无效短文本、断句碎片
  • 仅覆盖英语和法语
  • 数据来源为较早的 CommonCrawl 快照(如 2013 年),时效性不足
  • 社区反馈称该数据集是「deep quantum well」,工程处理复杂度高

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("tiiuae/falcon-refinedweb")