SummFlow 2026-06-07 Hugging Face

wikimedia / structured-wikipedia

英语和法语维基百科文章的结构化解析数据

1046.9万行 · 74.3 GB

  • 文本
  • cc-by-sa-4.0 · 可商用

下载 11k · 收藏 305 · 2个月前更新

社区实测

Hugging Face 上由 Wikimedia 官方维护的结构化 Wikipedia 快照,提供解析好的信息框、章节和 Wikidata 实体链接,省去 wikitext 解析,适合离线分析与社区复用,但需注意 CC-BY-SA-4.0 的衍生合规要求。

  • 无需自行解析 wikitext,直接获取结构化 Wikipedia 内容(信息框、章节、Wikidata 实体链接),跳过正则解析层
  • 提供定期刷新的 Wikipedia 快照,支持社区复用与大规模离线分析
  • CC-BY-SA-4.0 许可证要求署名和相同方式共享,衍生数据集或商用场景需评估合规风险
  • Wikimedia 基础设施偶发安全事件(如恶意脚本导致全站只读)可能造成数据更新中断

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("wikimedia/structured-wikipedia")

HuggingFaceFW / fineweb-edu

经教育质量分类器筛选的网页文本数据集

34.97亿行 · 6.2 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 506k · 收藏 1.1k · 1年前更新

社区实测

社区认可其开放透明(脚本完整公开)与教育子集的高质量,认为技术报告为预训练数据构建提供了宝贵参考

  • 预训练数据构建过程不透明:多数大模型厂商不公开数据细节,该数据集完整公开了所有处理脚本
  • 大规模高质量开源预训练数据的获取:15万亿token规模且质量超越同类数据集

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("HuggingFaceFW/fineweb-edu")

openbmb / Ultra-FineWeb

经验证过滤的高质量中英文网络文本数据集

12.90亿行 · 9.7 TB

  • 文本
  • 文本生成
  • apache-2.0 · 可商用
  • 含中文

下载 99k · 收藏 372 · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("openbmb/Ultra-FineWeb")

FreedomIntelligence / medical-o1-reasoning-SFT

基于医疗问题的推理链监督微调数据集

9.0万行 · 680 MB

  • 文本
  • 问答
  • 文本生成
  • apache-2.0 · 可商用
  • 含中文

下载 6.9k · 收藏 1.1k · 1年前更新

社区实测

HuatuoGPT-o1 的 SFT 训练数据集,由 GPT-4o 生成的带复杂思维链的医疗问答题,Apache 2.0 许可,社区主要将其用于医疗 LLM 推理能力微调。

  • 医疗推理 SFT 训练数据开源,附带 GPT-4o 生成的复杂思维链(Complex CoT)与答案
  • Apache 2.0 许可,允许商用
  • 中英双语医疗问答覆盖(en/zh 各约 2 万条)
  • 数据完全由 GPT-4o 合成生成,推理质量与医学准确性受限于生成模型,未经人工校验的合成数据可能包含幻觉或错误推理

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("FreedomIntelligence/medical-o1-reasoning-SFT")