数据集 / 归档 / 2026-07-06

2026-07-06 数据集 (8)

LocalLaws / LOCUS-v1

美国市县法律文本按法律功能标注的数据集

221.2万行 · 5.8 GB

  • 多模态
  • 文本分类
  • cc-by-nc-4.0 · 非商用

下载 2.2k · 收藏 87 · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("LocalLaws/LOCUS-v1")

Voxel51 / SceneFun3D

室内环境激光扫描点云,标注交互元素及其功能和运动参数

0 行 · 6.4 GB

  • 多模态
  • 目标检测
  • cc-by-nc-sa-4.0 · 非商用

下载 1.8k · 收藏 11 · 21天前更新

google / WaxalNLP

非洲语言的多语种语音数据,用于语音识别与合成

167.3万行 · 3.5 TB

  • 多模态
  • 语音识别
  • 语音合成
  • cc-by-sa-4.0 · 可商用

下载 35k · 收藏 246 · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("google/WaxalNLP")

Anthropic / hh-rlhf

人类对有用性和无害性的偏好数据,用于奖励模型训练

16.9万行 · 4.1 GB

  • 文本
  • mit · 可商用

下载 30k · 收藏 1.8k · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")

HuggingFaceFW / fineweb

从CommonCrawl清洗去重后的英文网页文本

524.54亿行 · 117.4 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 382k · 收藏 2.9k · 1年前更新

Open-Orca / OpenOrca

基于FLAN数据增强、对齐Orca论文分布的指令数据

294.2万行 · 63.5 GB

  • 文本
  • 文本分类
  • 序列标注
  • 表格问答
  • mit · 可商用

下载 17k · 收藏 1.6k · 1年前更新

  • py from datasets import load_dataset ds = load_dataset("Open-Orca/OpenOrca")

OpenAssistant / oasst1

多语言人工标注的助手对话语料,含质量评分

8.9万行 · 398 MB

  • 多模态
  • apache-2.0 · 可商用
  • 含中文

下载 16k · 收藏 1.5k · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("OpenAssistant/oasst1")

fka / prompts.chat

AI提示词社区分享平台的数据镜像

1,989 行 · 32 MB

  • 文本
  • 问答
  • 文本生成
  • cc0-1.0 · 可商用

下载 35k · 收藏 9.8k · 15天前更新

  • py from datasets import load_dataset ds = load_dataset("fka/prompts.chat")

← 前一日 2026-07-05 · 后一日 2026-07-07 →