数据集 / 归档 / 2026-06-08

2026-06-08 数据集 (7)

nvidia / Nemotron-Personas-Vietnam

基于越南人口分布生成的合成人物画像数据集

10.0万行 · 123 MB

  • 多模态
  • 文本生成
  • cc-by-4.0 · 可商用

下载 1.5k · 收藏 25 · 1个月前更新

社区实测

由FPT与NVIDIA联合发布的面向越南的合成人物画像数据集,约90万条,开放且允许商用,定位服务于越南及东南亚的主权AI与本地化应用开发。

  • 为越南及东南亚的本地化/主权AI开发提供开放可商用的数据基础
  • 覆盖越南语言、文化、劳动力及经济条件的人物画像,支撑更贴合本地场景的AI系统构建
  • 数据集为合成(synthetic)生成,非真实人群采样,在真实场景中的分布代表性未经独立验证

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("nvidia/Nemotron-Personas-Vietnam")

Nerfgun3 / bad_prompt

用于稳定扩散的负面提示词嵌入训练数据集

1 行 · 14 MB

  • 图像
  • creativeml-openrail-m · 可商用

下载 2.6k · 收藏 947 · 3年前更新

社区实测

能简化负面提示词编写并提升画质,但会显著改变画面艺术风格,使用前需权衡。

  • 将负面提示词统一为单个嵌入词,简化负面提示编写
  • 提升图像质量
  • 会完全改变画面艺术风格,非纯质量增强型嵌入
  • 文件名与触发词命名存在混淆(bad_prompt_v2 与 bad_prompt_version2)

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Nerfgun3/bad_prompt")

allenai / dolma

用于语言模型预训练研究的大规模英文开放语料库

6.1 TB

  • >1T
  • 文本生成
  • odc-by · 可商用

下载 4.4k · 收藏 1.0k · 2年前更新

社区实测

Dolma 是当时规模最大的开放预训练语料库,主要服务于 OLMo 模型训练,社区认可其透明度但实际使用中存在工程与合规摩擦。

  • 提供可公开获取、可审计的预训练数据,使研究者能间接研究闭源模型的训练数据构成
  • 覆盖网页、学术文献、代码、书籍、百科等多领域内容
  • 使用 AI2 Impact License 而非标准开放许可
  • HuggingFace 讨论区有用户标记法律合规问题
  • v1.7 存在重复文档
  • 已被 Dolma 3 取代,v1.x 不再是最新版本
  • 下载与存储工程门槛高,wget 脚本有覆盖/跳过问题
  • 流式访问报错,开箱体验不稳定

截至 2026-06-20

已被取代 Dolma 3 Dolmino · Dolma v1 已被 Dolma 3 Dolmino 取代,后者是 OLMo 3 第二阶段退火训练使用的高质量数据池。

databricks / databricks-dolly-15k

由Databricks员工生成的指令跟随数据集,涵盖多种任务类别

1.5万行 · 267 MB

  • 文本
  • 问答
  • 摘要
  • cc-by-sa-3.0 · 可商用

下载 32k · 收藏 982 · 3年前更新

社区实测

首个开放商用许可的人工生成指令数据集,但因规模小(15k条)且存在标注噪声、毒性内容等质量问题,已被更大更干净的数据集替代

  • 提供明确允许商用的开源指令微调数据集许可
  • 以人工众包方式生成指令-回复对,区别于纯合成数据路线
  • Cleanlab清洗版分析显示原始数据存在毒性评分高达0.99、非英语内容评分达0.91等质量问题
  • 部分回复含时效性事实陈述(如'曼联现任主帅是滕哈格'),已过时
  • 存在空回复(null)条目
  • 社区讨论质疑该数据集当前是否仍有价值

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("databricks/databricks-dolly-15k")

roneneldan / TinyStories

使用小词汇量由GPT-3.5和GPT-4生成的短故事数据集

214.2万行 · 17.3 GB

  • 文本
  • 文本生成
  • cdla-sharing-1.0 · 可商用

下载 86k · 收藏 1.0k · 1年前更新

社区实测

社区普遍认可其为小模型研究与架构实验的有效基准数据集,尤其适合在消费级硬件上快速验证新想法。

  • 让极小参数模型(低于5M)产出连贯英文文本
  • 让极简架构(单层transformer)也能生成可读故事
  • 为新型架构实验提供低门槛、可在消费级硬件上训练的基准
  • 通过限制词汇量(约1.5k词根)降低语言建模难度
  • 数据集为GPT-3.5/GPT-4合成生成,非真实语料
  • 词汇限定在3-4岁儿童水平,覆盖范围极窄
  • 领域单一(仅儿童故事),泛化能力有限

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("roneneldan/TinyStories")

tatsu-lab / alpaca

由OpenAI引擎生成的指令和示范数据集,用于指令微调

5.2万行 · 319 MB

  • 文本
  • 文本生成
  • cc-by-nc-4.0 · 非商用

下载 104k · 收藏 984 · 3年前更新

社区实测

早期有影响力的指令微调数据集,全量合成自 Self-Instruct,但因数据质量问题和底层模型许可限制,实际落地使用有限。

  • 提供了可复现的指令微调基线,52K 条合成数据即可让 7B 模型在 Self-Instruct 评测上接近 text-davinci-003
  • 以开源数据集+训练代码的形式降低了指令跟随研究的复现门槛
  • 数据存在明显的拼接/格式错误,部分样本中多条 instruction-response 被错误合并
  • 全量合成数据,生成依赖已弃用的 text-davinci-003,无法用原始方法复现或扩展
  • 基于 LLaMA 权重微调,衍生使用受 LLaMA 原始许可限制,商用需谨慎

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("tatsu-lab/alpaca")

tiiuae / falcon-refinedweb

从CommonCrawl过滤去重构建的大规模英文网络文本数据集

9.68亿行 · 1.7 TB

  • 文本
  • 文本生成
  • odc-by · 可商用

下载 14k · 收藏 923 · 3年前更新

社区实测

发布时 Falcon 凭此数据集登顶 Open LLM Leaderboard,证明了大规模过滤去重的纯网页数据路线可行,但 CommonCrawl 快照陈旧,如今已非首选。

  • Apache 2.0 许可,商用无额外限制
  • 证明经过严格过滤和去重的纯网页数据即可训练出超越精选语料混合物的模型,缓解了高质量语料规模焦虑
  • CommonCrawl 快照停留在 2013 年,数据时效性远落后于后续网页数据集
  • 仅覆盖英语和法语,多语言场景不可用
  • 原始网页数据中仍混杂 SEO 垃圾页等低质内容
  • 存在常见网页偏差

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("tiiuae/falcon-refinedweb")

← 前一日 2026-06-07 · 后一日 2026-06-09 →