数据集 / opencsg / chinese-fineweb-edu

opencsg / chinese-fineweb-edu

中文教育类网页语料,基于CommonCrawl过滤去重,约300GB,已弃用

作者
opencsg
规模
8463.8万行 · 588.5 GB
模态
文本
任务
文本生成
授权
apache-2.0 · 可商用
语种
zh
中文
含中文
下载
5,648
收藏
111

为什么值得用作为中文教育类预训练数据的早期开源参考,规模适中且可商用,适合快速原型验证或与新版V2.1进行对比实验

社区实测

2024年登上HuggingFace Trending,中文教育语料规模突出,但v2已被官方推荐用v2.1替代。

  • 提供大规模中文教育领域预训练语料(1.88亿条、约420B token),覆盖预训练教育大模型、智能辅导等场景
  • 使用须遵守OpenCSG Community License,商用需核查许可条款
  • v2已非最新版本,数据集卡片明确建议改用Fineweb-edu-chinese-v2.1

截至 2026-06-20

  • pyfrom datasets import load_dataset ds = load_dataset("opencsg/chinese-fineweb-edu")

观测时间线