数据集 / 归档 / 2026-07-21

2026-07-21 数据集 (7)

MCG-NJU / VideoChat3-Academic2M

学术视频指令数据,用于视频字幕、问答和动作理解

1.9万行 · 173.1 GB

  • 文本
  • video-text-to-text
  • apache-2.0 · 可商用

下载 2.0k · 收藏 20 · 2天前更新

  • py from datasets import load_dataset ds = load_dataset("MCG-NJU/VideoChat3-Academic2M")

HuggingFaceFW / fineweb

从CommonCrawl清洗去重后的英文网页文本数据集

524.54亿行 · 117.4 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 626k · 收藏 3.0k · 1年前更新

codeparrot / github-code

来自GitHub的代码文件,覆盖32种编程语言

669.9 GB

  • 文本生成
  • other · 待核

下载 5.7M · 收藏 406 · 3年前更新

Anthropic / hh-rlhf

人类偏好数据,用于训练帮助性和无害性奖励模型

16.9万行 · 4.1 GB

  • 文本
  • mit · 可商用

下载 32k · 收藏 1.8k · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")

OpenAssistant / oasst1

多语言人类助手对话数据集,包含质量评分

8.9万行 · 398 MB

  • 多模态
  • apache-2.0 · 可商用
  • 含中文

下载 18k · 收藏 1.6k · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("OpenAssistant/oasst1")

Open-Orca / OpenOrca

增强的FLAN指令数据集,用于对齐训练

294.2万行 · 63.5 GB

  • 文本
  • 文本分类
  • 序列标注
  • 表格问答
  • mit · 可商用

下载 17k · 收藏 1.6k · 1年前更新

  • py from datasets import load_dataset ds = load_dataset("Open-Orca/OpenOrca")

fka / prompts.chat

AI提示词(prompts)的社交平台镜像数据集

2,049 行 · 29 MB

  • 文本
  • 问答
  • 文本生成
  • cc0-1.0 · 可商用

下载 32k · 收藏 9.8k · 1天前更新

  • py from datasets import load_dataset ds = load_dataset("fka/prompts.chat")

← 前一日 2026-07-20 · 后一日 不可用 (已是最新)