SummFlow 2026-06-06 Hugging Face

HuggingFaceFW / fineweb

从CommonCrawl清洗去重的英文网络文本数据

524.54亿行 · 117.4 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 992k · 收藏 2.9k · 1年前更新

社区实测

大规模网页预训练语料(15 万亿 token),在同等规模数据集中表现领先

  • 提供 15 万亿 token 的高质量网页预训练语料,在同类规模中表现领先
  • FineWeb-Edu 子集提供 1.3 万亿 token 教育类高质量内容,满足对内容质量要求更高的预训练场景
  • 原始数据源自 Common Crawl,需经过大量过滤清洗才能达到可用质量

截至 2026-06-20

Open-Orca / OpenOrca

增强FLAN数据,对齐Orca论文的指令数据

294.2万行 · 63.5 GB

  • 文本
  • 文本分类
  • 序列标注
  • 表格问答
  • mit · 可商用

下载 25k · 收藏 1.6k · 1年前更新

社区实测

OpenOrca 是微软 Orca 论文思路的开源复现,用 GPT-4 生成指令数据训练小模型,社区反馈模型能力有提升但会「以为自己是 ChatGPT」。

  • 提供了一套可公开获取的 GPT-4 质量指令微调数据,降低复现 Orca 方法的门槛
  • 使较小参数量的开源模型在推理任务上获得可感知的提升
  • 作为基座数据与其他模型(如 Platypus2、OpenChat)合并后能产生优于各自单独使用的效果
  • 用该数据集训练的模型可能产生身份混淆,自称 ChatGPT 或表现出「妄想」行为

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Open-Orca/OpenOrca")

OpenAssistant / oasst1

多语言人类助手对话语料,含质量评级

8.9万行 · 1.6 GB

  • 多模态
  • apache-2.0 · 可商用
  • 含中文

下载 23k · 收藏 1.5k · 3年前更新

社区实测

社区众包收集的大规模对话数据集,带有人工质量/毒性/创意等多维标注,但项目已于2023年10月终止,被oasst2取代。

  • 提供了带人工多维标注(质量、毒性、幽默、创意等)的大规模开源对话数据
  • 可在自有硬件上运行基于该数据集训练的模型
  • 2023年4月发布的版本过滤了'不安全'内容,非原始完整采集数据
  • 基于LLaMA的模型存在许可证问题,需通过XOR方式分发
  • 项目已于2023年10月终止,被oasst2取代
  • LLaMA模型权重文件曾出现全为零的情况

截至 2026-06-20

已被取代 oasst2 · oasst1 为 2023 年 4 月的中期快照,oasst2 为数据收集结束后的最终版本

  • py from datasets import load_dataset ds = load_dataset("OpenAssistant/oasst1")