数据集 / roneneldan / TinyStories

roneneldan / TinyStories

GPT生成的小词汇表短故事数据集

作者
roneneldan
规模
214.2万行 · 17.3 GB
模态
文本
任务
文本生成
授权
cdla-sharing-1.0 · 可商用
语种
en
下载
85,038
收藏
1,052

社区实测

社区普遍认可其为小模型研究与架构实验的有效基准数据集,尤其适合在消费级硬件上快速验证新想法。

  • 让极小参数模型(低于5M)产出连贯英文文本
  • 让极简架构(单层transformer)也能生成可读故事
  • 为新型架构实验提供低门槛、可在消费级硬件上训练的基准
  • 通过限制词汇量(约1.5k词根)降低语言建模难度
  • 数据集为GPT-3.5/GPT-4合成生成,非真实语料
  • 词汇限定在3-4岁儿童水平,覆盖范围极窄
  • 领域单一(仅儿童故事),泛化能力有限

截至 2026-06-20

  • pyfrom datasets import load_dataset ds = load_dataset("roneneldan/TinyStories")

观测时间线