tiiuae / falcon-refinedweb
从CommonCrawl过滤去重得到的大型英文网页数据集。
下载 22k · 收藏 914 · 3年前更新
社区实测
以 Apache 2.0 许可公开的大规模网页数据集,学术上证明了纯网页数据经过滤去重可超越精选语料,但实际样本质量参差、社区上手门槛高。
- Apache 2.0 许可,商用友好
- 证明经严格过滤和去重的纯网页数据训练效果可超越基于 The Pile 等精选语料的模型
- 公开释放 600B tokens,规模足以支撑大模型预训练和复现
- 样本中存在大量低质量网页噪音,如博客评论、无效短文本、断句碎片
- 仅覆盖英语和法语
- 数据来源为较早的 CommonCrawl 快照(如 2013 年),时效性不足
- 社区反馈称该数据集是「deep quantum well」,工程处理复杂度高
来源
tiiuae/falcon-refinedweb · Datasets at Hugging FaceAI Model Catalog | Microsoft Foundry Models[2306.01116] The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated ...
截至 2026-06-20
- py from datasets import load_dataset ds = load_dataset("tiiuae/falcon-refinedweb")