数据集 / 归档 / 2026-07-08

2026-07-08 数据集 (8)

LiquidAI / antidoom-mix-v1.0

面向antidoom风格生成和偏好数据的仅提示训练混合

0 行 · -5327512480 B

  • 文本生成
  • apache-2.0 · 可商用

下载 86 · 收藏 23 · 14天前更新

ruggsea / infini-news-corpus

从Common Crawl CC-News提取的多语言新闻语料

13.57亿行 · 3.6 TB

  • 多模态
  • 文本生成
  • 文本分类
  • text-retrieval
  • cc-by-4.0 · 可商用
  • 含中文

下载 30k · 收藏 18 · 20天前更新

Nerfgun3 / bad_prompt

用于负面提示的文本嵌入/嵌入文件

1 行 · 14 MB

  • 图像
  • creativeml-openrail-m · 可商用

下载 1.7k · 收藏 952 · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("Nerfgun3/bad_prompt")

allenai / dolma

开放语料库,用于语言模型预训练研究

6.1 TB

  • >1T
  • 文本生成
  • odc-by · 可商用

下载 4.1k · 收藏 1.1k · 2年前更新

databricks / databricks-dolly-15k

由人工生成的指令跟随数据集,覆盖多种任务类型

1.5万行 · 267 MB

  • 文本
  • 问答
  • 摘要
  • cc-by-sa-3.0 · 可商用

下载 42k · 收藏 995 · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("databricks/databricks-dolly-15k")

roneneldan / TinyStories

GPT生成的小词汇表短故事数据集

214.2万行 · 17.3 GB

  • 文本
  • 文本生成
  • cdla-sharing-1.0 · 可商用

下载 85k · 收藏 1.1k · 1年前更新

  • py from datasets import load_dataset ds = load_dataset("roneneldan/TinyStories")

tatsu-lab / alpaca

由OpenAI引擎生成的指令和演示数据集

5.2万行 · 319 MB

  • 文本
  • 文本生成
  • cc-by-nc-4.0 · 非商用

下载 80k · 收藏 1.0k · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("tatsu-lab/alpaca")

tiiuae / falcon-refinedweb

过滤和去重后的英文CommonCrawl网页数据集

9.68亿行 · 1.7 TB

  • 文本
  • 文本生成
  • odc-by · 可商用

下载 15k · 收藏 932 · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("tiiuae/falcon-refinedweb")

← 前一日 2026-07-07 · 后一日 2026-07-09 →