数据集 / 归档 / 2026-05-24

2026-05-24 数据集 (6)

Nerfgun3 / bad_prompt

用于Stable Diffusion的负向提示嵌入向量。

1 行 · 14 MB

  • 图像
  • creativeml-openrail-m · 可商用

下载 2.6k · 收藏 942 · 3年前更新

社区实测

社区将其作为负向提示词的快捷嵌入使用,能简化负面 prompt 编写,但存在兼容性报错和版本选择困惑。

  • 将常用的负向提示词骨架训练为单一嵌入,省去每次手写长负面 prompt 的麻烦
  • 配合权重使用(如 0.7–0.8)可提升出图质量
  • 与某些环境组合时触发 torch.cuda.HalfTensor 类型不匹配的 RuntimeError
  • bad_prompt_v2 与 bad_prompt_version2 名称混淆,二者对出图的影响程度不同
  • 嵌入会改变画面风格(artstyle),非所有场景适用

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Nerfgun3/bad_prompt")

allenai / dolma

包含3万亿token的英文语料,用于语言模型预训练研究。

6.1 TB

  • >1T
  • 文本生成
  • odc-by · 可商用

下载 4.8k · 收藏 1.0k · 2年前更新

社区实测

社区认可其作为当时最大规模开放预训练语料的研究价值,但 AI2 Impact License 并非标准开放许可,实际开放性存在争议

  • 提供了可公开获取的大规模预训练语料,使研究者能间接研究甚至审查闭源模型的训练数据构成
  • 提供多版本发布(v1.5/v1.7),支持训练可复现性
  • 采用 AI2 Impact License 而非标准开放许可(如 CC),商用存在限制
  • v1.7 版本(4.5TB)相比 v1.5(6.4TB)数据量大幅缩减,部分数据被移除

截至 2026-06-20

databricks / databricks-dolly-15k

Databricks员工生成的指令跟随数据,覆盖多种任务类别。

1.5万行 · 267 MB

  • 文本
  • 问答
  • 摘要
  • cc-by-sa-3.0 · 可商用

下载 34k · 收藏 971 · 3年前更新

社区实测

首个开源可商用的真人标注指令数据集,开创性意义大于实用价值,当前已被更大规模数据集替代

  • 提供了首个开源、可商用的真人标注指令微调数据集,填补了空白
  • 验证了用高质量指令数据在单机上数小时内即可让旧模型获得 ChatGPT 式交互能力
  • 原始数据存在 PII、毒性内容、非正式语言等质量问题,社区已有 Cleanlab 清洗版
  • 数据量仅 15k 条,已被后续更大规模指令数据集超越,社区质疑其当前实用价值

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("databricks/databricks-dolly-15k")

roneneldan / TinyStories

由GPT-3.5/4生成的短篇故事,词汇量小。

214.2万行 · 17.3 GB

  • 文本
  • 文本生成
  • cdla-sharing-1.0 · 可商用

下载 89k · 收藏 992 · 1年前更新

社区实测

微软研究院推出的合成短故事数据集,因被用于 Baby LLaMA 2 等小模型实验而在 Hacker News 上引发关注与讨论

  • 为小规模语言模型训练与实验提供可控、低资源需求的合成文本数据
  • 可用于编程竞赛或教学场景中的语言模型相关题目设计

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("roneneldan/TinyStories")

tatsu-lab / alpaca

由OpenAI text-davinci-003生成的指令和演示数据。

5.2万行 · 319 MB

  • 文本
  • 文本生成
  • cc-by-nc-4.0 · 非商用

下载 108k · 收藏 968 · 3年前更新

社区实测

早期开源指令微调标杆,因合成数据质量参差和底层依赖已弃用的标注模型,更适合作为历史参考而非生产首选。

  • 提供了 52K 条 Self-Instruct 生成的指令跟随数据,降低了指令微调研究的复现门槛
  • 配套 AlpacaEval/AlpacaFarm 提供了低成本、可复现的自动化评估方案
  • 合成数据存在指令与回复拼接错误等标注噪声
  • 原始数据生成依赖已弃用的 text-davinci-003,复现需更换自动标注器
  • 基于 LLaMA 衍生,需关注底层模型的许可约束

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("tatsu-lab/alpaca")

tiiuae / falcon-refinedweb

从CommonCrawl过滤去重得到的大型英文网页数据集。

9.68亿行 · 1.7 TB

  • 文本
  • 文本生成
  • odc-by · 可商用

下载 22k · 收藏 914 · 3年前更新

社区实测

以 Apache 2.0 许可公开的大规模网页数据集,学术上证明了纯网页数据经过滤去重可超越精选语料,但实际样本质量参差、社区上手门槛高。

  • Apache 2.0 许可,商用友好
  • 证明经严格过滤和去重的纯网页数据训练效果可超越基于 The Pile 等精选语料的模型
  • 公开释放 600B tokens,规模足以支撑大模型预训练和复现
  • 样本中存在大量低质量网页噪音,如博客评论、无效短文本、断句碎片
  • 仅覆盖英语和法语
  • 数据来源为较早的 CommonCrawl 快照(如 2013 年),时效性不足
  • 社区反馈称该数据集是「deep quantum well」,工程处理复杂度高

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("tiiuae/falcon-refinedweb")

← 前一日 2026-05-23 · 后一日 2026-05-25 →