数据集 / 归档 / 2026-06-23

2026-06-23 数据集 (8)

allenai / molmo-motion-1m

3D点轨迹和2D像素轨迹的视频动作数据集,覆盖7个语料库

0 行 · 285.6 GB

  • other
  • other · 待核

下载 1.4k · 收藏 13 · 1个月前更新

ibm-research / ScarfBench

企业Java应用迁移基准,覆盖Jakarta EE、Quarkus、Spring

41 MB

  • 文本生成

下载 215 · 收藏 16 · 2个月前更新

Nerfgun3 / bad_prompt

负提示嵌入/文本反转数据集,用于稳定扩散

1 行 · 14 MB

  • 图像
  • creativeml-openrail-m · 可商用

下载 1.9k · 收藏 949 · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("Nerfgun3/bad_prompt")

allenai / dolma

用于语言模型预训练研究的开放语料库

6.1 TB

  • >1T
  • 文本生成
  • odc-by · 可商用

下载 4.1k · 收藏 1.0k · 2年前更新

databricks / databricks-dolly-15k

由Databricks员工编写,涵盖多个行为类别的指令跟随数据

1.5万行 · 267 MB

  • 文本
  • 问答
  • 摘要
  • cc-by-sa-3.0 · 可商用

下载 35k · 收藏 986 · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("databricks/databricks-dolly-15k")

roneneldan / TinyStories

由GPT-3.5和GPT-4生成的短故事,使用受限词汇

214.2万行 · 17.3 GB

  • 文本
  • 文本生成
  • cdla-sharing-1.0 · 可商用

下载 83k · 收藏 1.0k · 1年前更新

  • py from datasets import load_dataset ds = load_dataset("roneneldan/TinyStories")

tatsu-lab / alpaca

由text-davinci-003生成的指令和演示数据,用于指令微调

5.2万行 · 319 MB

  • 文本
  • 文本生成
  • cc-by-nc-4.0 · 非商用

下载 75k · 收藏 995 · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("tatsu-lab/alpaca")

tiiuae / falcon-refinedweb

经严格过滤和去重的英文网络语料库

9.68亿行 · 1.7 TB

  • 文本
  • 文本生成
  • odc-by · 可商用

下载 12k · 收藏 929 · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("tiiuae/falcon-refinedweb")

← 前一日 2026-06-22 · 后一日 2026-06-24 →