数据集 / 归档 / 2026-05-22

2026-05-22 数据集 (8)

actava / chi-bench

美国医疗工作流的AI智能体基准测试,覆盖三个长期域。

101 行 · 929 KB

  • 多模态
  • 文本生成
  • apache-2.0 · 可商用

下载 1.2k · 收藏 25 · 2个月前更新

  • py from datasets import load_dataset ds = load_dataset("actava/chi-bench")

HuggingFaceFW / fineweb

从CommonCrawl清洗去重的英文网页文本数据集。

524.54亿行 · 117.4 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 970k · 收藏 2.8k · 1年前更新

社区实测

社区认可其开放性与可复现性,所有处理脚本公开,信息详尽

  • 提供高质量开源训练数据资源
  • 数据处理流程完全透明可复现
  • 多语言训练数据基准(FineWeb2)

截至 2026-06-20

GD-ML / TransitLM

中国四城市公共交通路线规划数据集,含坐标与换乘结构。

15.0万行 · 53.0 GB

  • 多模态
  • 文本生成
  • cc-by-nc-4.0 · 非商用
  • 含中文

下载 522 · 收藏 17 · 2个月前更新

  • py from datasets import load_dataset ds = load_dataset("GD-ML/TransitLM")

HuggingFaceBio / carbon-pretraining-corpus

DNA和RNA序列的基因组预训练语料,覆盖真核与原核物种。

1.80亿行 · 1.3 TB

  • 多模态
  • 文本生成
  • other · 待核

下载 2.9k · 收藏 17 · 2个月前更新

  • py from datasets import load_dataset ds = load_dataset("HuggingFaceBio/carbon-pretraining-corpus")

Anthropic / hh-rlhf

人类对有用性和无害性的偏好数据,用于RLHF训练。

16.9万行 · 4.1 GB

  • 文本
  • mit · 可商用

下载 38k · 收藏 1.7k · 3年前更新

社区实测

作为早期大规模 RLHF 偏好数据集被广泛引用,但社区实测发现部分标注存在人工错误

  • 提供 helpfulness 与 harmlessness 两个维度的人类偏好对比数据,用于 RLHF 对齐训练
  • 人工标注存在错误,部分 rejected 回复实际质量优于 chosen 回复

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")

Open-Orca / OpenOrca

增强的FLAN数据集,用于训练对话模型。

294.2万行 · 63.5 GB

  • 文本
  • 文本分类
  • 序列标注
  • 表格问答
  • mit · 可商用

下载 50k · 收藏 1.5k · 1年前更新

社区实测

OpenOrca 试图以开源方式复现 Orca 论文的 GPT-4 推理数据构造方法,社区反馈模型效果不错但存在身份幻觉——模型会误以为自己是 ChatGPT。

  • 以开源方式复现了 Orca 论文的数据收集方法,让开源模型能学习 GPT-4 的推理模式
  • 推动更小、更快、更聪明的开源模型开发
  • 用该数据集训练的模型可能出现身份幻觉,自称是 OpenAI 开发的 ChatGPT

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Open-Orca/OpenOrca")

OpenAssistant / oasst1

35种语言的人类助手对话语料,含质量评分。

8.9万行 · 1.6 GB

  • 多模态
  • apache-2.0 · 可商用
  • 含中文

下载 24k · 收藏 1.5k · 3年前更新

社区实测

社区认可其作为早期大规模开源人类标注指令数据集的价值,但项目活跃窗口短、oasst1 被 oasst2 取代,且衍生模型因 Llama 许可证问题分发受阻。

  • 提供了一套社区众包、带多维质量标签的人类指令微调数据集,用于复现类 ChatGPT 的开源对话 AI
  • 以开放数据集降低开源对话模型研发的数据门槛
  • oasst1(2023 年 4 月版)过滤了"不安全"内容,非全量原始数据
  • 基于 Llama 的衍生模型因许可证限制无法直接分发,只能以 XOR 文件形式规避
  • 数据收集已于 2023 年 10 月终止,oasst1 已被 oasst2 取代,不再是最终版本

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("OpenAssistant/oasst1")

fka / prompts.chat

社区分享的AI提示词数据集。

1,823 行 · 29 MB

  • 文本
  • 问答
  • 文本生成
  • cc0-1.0 · 可商用

下载 53k · 收藏 9.7k · 2个月前更新

社区实测

由 awesome-chatgpt-prompts 演进而来的开源提示词集合,社区视其为从静态列表升级为可自托管工具的延续

  • 提供免费、开源、可自托管的提示词收集与分享工具
  • 以 Hugging Face 数据集形式提供,便于程序化访问与集成
  • 从原有 awesome-chatgpt-prompts 仓库升级为端到端工具
  • 提示词内容存在持续增删维护,部分旧提示词被移除或改写,稳定性一般

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("fka/prompts.chat")

← 前一日 2026-05-21 · 后一日 2026-05-23 →