SummFlow 2026-06-08 Hugging Face

tiiuae / falcon-refinedweb

从CommonCrawl过滤去重构建的大规模英文网络文本数据集

9.68亿行 · 1.7 TB

  • 文本
  • 文本生成
  • odc-by · 可商用

下载 14k · 收藏 923 · 3年前更新

社区实测

发布时 Falcon 凭此数据集登顶 Open LLM Leaderboard,证明了大规模过滤去重的纯网页数据路线可行,但 CommonCrawl 快照陈旧,如今已非首选。

  • Apache 2.0 许可,商用无额外限制
  • 证明经过严格过滤和去重的纯网页数据即可训练出超越精选语料混合物的模型,缓解了高质量语料规模焦虑
  • CommonCrawl 快照停留在 2013 年,数据时效性远落后于后续网页数据集
  • 仅覆盖英语和法语,多语言场景不可用
  • 原始网页数据中仍混杂 SEO 垃圾页等低质内容
  • 存在常见网页偏差

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("tiiuae/falcon-refinedweb")