SummFlow 2026-06-08 Hugging Face

roneneldan / TinyStories

使用小词汇量由GPT-3.5和GPT-4生成的短故事数据集

214.2万行 · 17.3 GB

  • 文本
  • 文本生成
  • cdla-sharing-1.0 · 可商用

下载 86k · 收藏 1.0k · 1年前更新

社区实测

社区普遍认可其为小模型研究与架构实验的有效基准数据集,尤其适合在消费级硬件上快速验证新想法。

  • 让极小参数模型(低于5M)产出连贯英文文本
  • 让极简架构(单层transformer)也能生成可读故事
  • 为新型架构实验提供低门槛、可在消费级硬件上训练的基准
  • 通过限制词汇量(约1.5k词根)降低语言建模难度
  • 数据集为GPT-3.5/GPT-4合成生成,非真实语料
  • 词汇限定在3-4岁儿童水平,覆盖范围极窄
  • 领域单一(仅儿童故事),泛化能力有限

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("roneneldan/TinyStories")

tatsu-lab / alpaca

由OpenAI引擎生成的指令和示范数据集,用于指令微调

5.2万行 · 319 MB

  • 文本
  • 文本生成
  • cc-by-nc-4.0 · 非商用

下载 104k · 收藏 984 · 3年前更新

社区实测

早期有影响力的指令微调数据集,全量合成自 Self-Instruct,但因数据质量问题和底层模型许可限制,实际落地使用有限。

  • 提供了可复现的指令微调基线,52K 条合成数据即可让 7B 模型在 Self-Instruct 评测上接近 text-davinci-003
  • 以开源数据集+训练代码的形式降低了指令跟随研究的复现门槛
  • 数据存在明显的拼接/格式错误,部分样本中多条 instruction-response 被错误合并
  • 全量合成数据,生成依赖已弃用的 text-davinci-003,无法用原始方法复现或扩展
  • 基于 LLaMA 权重微调,衍生使用受 LLaMA 原始许可限制,商用需谨慎

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("tatsu-lab/alpaca")

tiiuae / falcon-refinedweb

从CommonCrawl过滤去重构建的大规模英文网络文本数据集

9.68亿行 · 1.7 TB

  • 文本
  • 文本生成
  • odc-by · 可商用

下载 14k · 收藏 923 · 3年前更新

社区实测

发布时 Falcon 凭此数据集登顶 Open LLM Leaderboard,证明了大规模过滤去重的纯网页数据路线可行,但 CommonCrawl 快照陈旧,如今已非首选。

  • Apache 2.0 许可,商用无额外限制
  • 证明经过严格过滤和去重的纯网页数据即可训练出超越精选语料混合物的模型,缓解了高质量语料规模焦虑
  • CommonCrawl 快照停留在 2013 年,数据时效性远落后于后续网页数据集
  • 仅覆盖英语和法语,多语言场景不可用
  • 原始网页数据中仍混杂 SEO 垃圾页等低质内容
  • 存在常见网页偏差

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("tiiuae/falcon-refinedweb")