roneneldan / TinyStories
使用小词汇量由GPT-3.5和GPT-4生成的短故事数据集
下载 86k · 收藏 1.0k · 1年前更新
社区实测
社区普遍认可其为小模型研究与架构实验的有效基准数据集,尤其适合在消费级硬件上快速验证新想法。
- 让极小参数模型(低于5M)产出连贯英文文本
- 让极简架构(单层transformer)也能生成可读故事
- 为新型架构实验提供低门槛、可在消费级硬件上训练的基准
- 通过限制词汇量(约1.5k词根)降低语言建模难度
- 数据集为GPT-3.5/GPT-4合成生成,非真实语料
- 词汇限定在3-4岁儿童水平,覆盖范围极窄
- 领域单一(仅儿童故事),泛化能力有限
来源
TinyStories: How Small Can Language Models Be and Still Speak Coherent English | OpenReviewThe Smallest GPT with Coherent English (by Microsoft) : r/LocalLLaMAroneneldan/TinyStories-33M Free Chat Online - skywork.ai - SkyworkFor small models this is for sure the way forward ... - Hacker News
截至 2026-06-20
- py from datasets import load_dataset ds = load_dataset("roneneldan/TinyStories")