SummFlow 2026-06-08 Hugging Face

roneneldan / TinyStories

使用小词汇量由GPT-3.5和GPT-4生成的短故事数据集

214.2万行 · 17.3 GB

  • 文本
  • 文本生成
  • cdla-sharing-1.0 · 可商用

下载 86k · 收藏 1.0k · 1年前更新

社区实测

社区普遍认可其为小模型研究与架构实验的有效基准数据集,尤其适合在消费级硬件上快速验证新想法。

  • 让极小参数模型(低于5M)产出连贯英文文本
  • 让极简架构(单层transformer)也能生成可读故事
  • 为新型架构实验提供低门槛、可在消费级硬件上训练的基准
  • 通过限制词汇量(约1.5k词根)降低语言建模难度
  • 数据集为GPT-3.5/GPT-4合成生成,非真实语料
  • 词汇限定在3-4岁儿童水平,覆盖范围极窄
  • 领域单一(仅儿童故事),泛化能力有限

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("roneneldan/TinyStories")