opencsg / chinese-fineweb-edu
中文教育类网页语料,基于CommonCrawl过滤去重,约300GB,已弃用
下载 5.6k · 收藏 111 · 7个月前更新
- 采用与FineWeb-Edu类似的教育价值分类器对CommonCrawl进行筛选,聚焦中文教育内容
- 规模约300GB、约9000万文本片段,适合中文预训练或继续预训练
- Apache-2.0许可,理论上支持商业使用
- 提供技术报告(arxiv 2501.08197)详细说明筛选流程
为什么值得用作为中文教育类预训练数据的早期开源参考,规模适中且可商用,适合快速原型验证或与新版V2.1进行对比实验
- 去重:README提及经过去重流程,但未说明去重粒度(文档级/段落级)及具体方法
- 评分模型训练数据量小('a small amount of data'),可能引入分类偏差,影响教育价值判断的稳定性
- 未声明是否包含合成数据,在敏感场景下需额外验证
- 基于CommonCrawl原始数据,可能存在低质或噪声文本,过滤器的泛化能力需复现验证
- 当前版本已deprecated,官方明确推荐使用新版FineWeb-Edu-Chinese-V2.1
- 未公开数据污染检测结果与合成数据比例,需用户自行评估
- 仅含网页文本,缺少代码或结构化数据,领域覆盖可能不均衡
来源
chinese-fineweb-edu-v2 - 数据集详情页FineWeb-Edu: Quality Educational Web DataHow did the OpenCSG Chinese open source dataset team build 188 ...
社区实测
2024年登上HuggingFace Trending,中文教育语料规模突出,但v2已被官方推荐用v2.1替代。
- 提供大规模中文教育领域预训练语料(1.88亿条、约420B token),覆盖预训练教育大模型、智能辅导等场景
- 使用须遵守OpenCSG Community License,商用需核查许可条款
- v2已非最新版本,数据集卡片明确建议改用Fineweb-edu-chinese-v2.1
来源
opencsg/chinese-fineweb-edu-v2 · Datasets at Hugging Face重磅升级| OpenCSG开源中文版fineweb edu v2数据集What Datasets Are Available for Chinese Large Models? Here's Our ...
截至 2026-06-20
- py from datasets import load_dataset ds = load_dataset("opencsg/chinese-fineweb-edu")