数据集 / 归档 / 2026-06-21

2026-06-21 数据集 (10)

Glint-Research / Complete-FABLE.5-traces-2M

FABLE.5/Mythos 语料库的完整恢复版本,移除会话限制答案行

200.6万行 · 0 B

  • 文本生成
  • mit · 可商用

下载 901 · 收藏 30 · 1个月前更新

LocalLaws / LOCUS-v1

美国市县级法律文本的块级数据集,标注法律功能和主题

221.2万行 · 5.8 GB

  • 多模态
  • 文本分类
  • cc-by-nc-4.0 · 非商用

下载 723 · 收藏 20 · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("LocalLaws/LOCUS-v1")

Anthropic / hh-rlhf

关于有用性和无害性的人类偏好数据,用于 RLHF 训练

16.9万行 · 4.1 GB

  • 文本
  • mit · 可商用

下载 31k · 收藏 1.8k · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")

HuggingFaceFW / fineweb

来自 CommonCrawl 的清洗去重英文网络文本

524.54亿行 · 117.4 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 377k · 收藏 2.9k · 1年前更新

Open-Orca / OpenOrca

增强的 FLAN 数据集,对齐 Orca 论文中的分布

294.2万行 · 63.5 GB

  • 文本
  • 文本分类
  • 序列标注
  • 表格问答
  • mit · 可商用

下载 18k · 收藏 1.6k · 1年前更新

  • py from datasets import load_dataset ds = load_dataset("Open-Orca/OpenOrca")

OpenAssistant / oasst1

跨 35 种语言的人类生成标注助手对话语料

8.9万行 · 1.6 GB

  • 多模态
  • apache-2.0 · 可商用
  • 含中文

下载 16k · 收藏 1.5k · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("OpenAssistant/oasst1")

OpenAssistant / oasst2

众包多语言助手指令对话集,含质量评分与毒性检测

13.5万行 · 1.7 GB

  • 人工精选
  • 多模态
  • apache-2.0 · 可商用
  • 含中文

下载 7.0k · 收藏 292 · 2年前更新

为什么值得用作为开源社区活跃维护的多语言对齐数据集,适合快速验证模型指令跟随能力及多语言泛化性

  • py from datasets import load_dataset ds = load_dataset("OpenAssistant/oasst2")

allenai / dolma3_dolmino_mix-100B-1125

100B token合成混合,专为Olmo 3第二阶段退火训练设计,覆盖数学/代码/推理

0 行 · 319.5 GB

  • 人工精选
  • odc-by · 可商用

下载 30k · 收藏 20 · 4个月前更新

为什么值得用若需要快速获取一批针对数学、代码、推理等能力的合成训练/微调样本,本数据集可直接加载text字段使用,无需额外清洗。

fka / prompts.chat

从 prompts.chat 平台收集的 AI 提示词数据集

0 行 · 29 MB

  • 文本
  • 问答
  • 文本生成
  • cc0-1.0 · 可商用

下载 31k · 收藏 9.7k · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("fka/prompts.chat")

togethercomputer / RedPajama-Data-V2

基于84个CommonCrawl快照的百亿级多语言预训练语料,含质量信号与去重ID

138.2 GB

  • 人工精选
  • 文本生成

下载 6.9k · 收藏 403 · 1年前更新

为什么值得用作为公开可复现的大规模Web语料基座,配合质量信号可定制训练数据,适合需要灵活过滤与研究的团队

← 前一日 2026-06-20 · 后一日 2026-06-22 →