数据集 / 归档 / 2026-06-06

2026-06-06 数据集 (7)

nvidia / Nemotron-Personas-El-Salvador

萨尔瓦多西班牙语合成人格数据,基于真实分布

14.8万行 · 1.1 GB

  • 文本
  • 文本生成
  • cc-by-4.0 · 可商用

下载 1.4k · 收藏 31 · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("nvidia/Nemotron-Personas-El-Salvador")

julien-c / synthtraces

合成编码智能体会话轨迹,远程模型与本地模型配对

2,876 行 · 2.0 GB

  • 多模态
  • mit · 可商用

下载 1.6k · 收藏 23 · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("julien-c/synthtraces")

Anthropic / hh-rlhf

人类偏好数据,用于RLHF训练帮助性和无害性

16.9万行 · 4.1 GB

  • 文本
  • mit · 可商用

下载 37k · 收藏 1.8k · 3年前更新

社区实测

作为 RLHF 早期开源基准被广泛引用,但社区实际使用中发现标注质量参差不齐,部分样本的偏好标签存在明显错误。

  • 提供大规模人类偏好数据用于安全对齐(safety-focused alignment)训练
  • 数据格式简单(每行一对 chosen/rejected 文本),可直接用于偏好模型训练
  • 提供 train/test 划分,方便复现评估
  • 标注存在噪声:部分样本中 rejected 回复质量实际优于 chosen 回复,可能是人工标注失误所致

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")

HuggingFaceFW / fineweb

从CommonCrawl清洗去重的英文网络文本数据

524.54亿行 · 117.4 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 992k · 收藏 2.9k · 1年前更新

社区实测

大规模网页预训练语料(15 万亿 token),在同等规模数据集中表现领先

  • 提供 15 万亿 token 的高质量网页预训练语料,在同类规模中表现领先
  • FineWeb-Edu 子集提供 1.3 万亿 token 教育类高质量内容,满足对内容质量要求更高的预训练场景
  • 原始数据源自 Common Crawl,需经过大量过滤清洗才能达到可用质量

截至 2026-06-20

Open-Orca / OpenOrca

增强FLAN数据,对齐Orca论文的指令数据

294.2万行 · 63.5 GB

  • 文本
  • 文本分类
  • 序列标注
  • 表格问答
  • mit · 可商用

下载 25k · 收藏 1.6k · 1年前更新

社区实测

OpenOrca 是微软 Orca 论文思路的开源复现,用 GPT-4 生成指令数据训练小模型,社区反馈模型能力有提升但会「以为自己是 ChatGPT」。

  • 提供了一套可公开获取的 GPT-4 质量指令微调数据,降低复现 Orca 方法的门槛
  • 使较小参数量的开源模型在推理任务上获得可感知的提升
  • 作为基座数据与其他模型(如 Platypus2、OpenChat)合并后能产生优于各自单独使用的效果
  • 用该数据集训练的模型可能产生身份混淆,自称 ChatGPT 或表现出「妄想」行为

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Open-Orca/OpenOrca")

OpenAssistant / oasst1

多语言人类助手对话语料,含质量评级

8.9万行 · 1.6 GB

  • 多模态
  • apache-2.0 · 可商用
  • 含中文

下载 23k · 收藏 1.5k · 3年前更新

社区实测

社区众包收集的大规模对话数据集,带有人工质量/毒性/创意等多维标注,但项目已于2023年10月终止,被oasst2取代。

  • 提供了带人工多维标注(质量、毒性、幽默、创意等)的大规模开源对话数据
  • 可在自有硬件上运行基于该数据集训练的模型
  • 2023年4月发布的版本过滤了'不安全'内容,非原始完整采集数据
  • 基于LLaMA的模型存在许可证问题,需通过XOR方式分发
  • 项目已于2023年10月终止,被oasst2取代
  • LLaMA模型权重文件曾出现全为零的情况

截至 2026-06-20

已被取代 oasst2 · oasst1 为 2023 年 4 月的中期快照,oasst2 为数据收集结束后的最终版本

  • py from datasets import load_dataset ds = load_dataset("OpenAssistant/oasst1")

fka / prompts.chat

AI提示词社区收集的提示词数据集

1,858 行 · 29 MB

  • 文本
  • 问答
  • 文本生成
  • cc0-1.0 · 可商用

下载 27k · 收藏 9.7k · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("fka/prompts.chat")

← 前一日 2026-06-05 · 后一日 2026-06-07 →