allenai / dolma3_dolmino_mix-100B-1125
100B token合成混合,专为Olmo 3第二阶段退火训练设计,覆盖数学/代码/推理
- 由AllenAI为OLMo 3 32B中期训练筛选的高质量合成数据池,目标提升数学、代码、QA、指令理解与思考能力
- 包含12种以上不同来源的合成数据(如TinyMATH、CraneCode、Nemotron QA等),覆盖较广的技能维度
- 采用ODC-BY开源许可,可商用途经署名即可使用
为什么值得用若需要快速获取一批针对数学、代码、推理等能力的合成训练/微调样本,本数据集可直接加载text字段使用,无需额外清洗。
- 合成数据占比100%,存在模式化和伪相关风险,尤其数学和推理数据可能高度模板化
- 未公开去重策略及重复率,同一来源内部可能存在近重复样本
- 数据来源为多管道生成,噪声水平不一(如网络爬取部分经过STEM筛选,但合成QA质量依赖提示设计)
- 数据集曾用于Olmo 3训练,若直接用于评测存在潜在泄漏(需确认时间和任务范围)
- 全部为合成数据,缺乏自然文本多样性,在真实场景泛化上可能受限
- 仅包含英文,不支持多语言任务
- ODC-BY许可要求明确署名,需注意合规性