数据集 / 归档 / 2026-06-21
2026-06-21 数据集 (10)
FABLE.5/Mythos 语料库的完整恢复版本,移除会话限制答案行
下载 901 · 收藏 30 · 1个月前更新
美国市县级法律文本的块级数据集,标注法律功能和主题
下载 723 · 收藏 20 · 1个月前更新
- py from datasets import load_dataset
ds = load_dataset("LocalLaws/LOCUS-v1") 复制
关于有用性和无害性的人类偏好数据,用于 RLHF 训练
下载 31k · 收藏 1.8k · 3年前更新
- py from datasets import load_dataset
ds = load_dataset("Anthropic/hh-rlhf") 复制
来自 CommonCrawl 的清洗去重英文网络文本
下载 377k · 收藏 2.9k · 1年前更新
增强的 FLAN 数据集,对齐 Orca 论文中的分布
下载 18k · 收藏 1.6k · 1年前更新
- py from datasets import load_dataset
ds = load_dataset("Open-Orca/OpenOrca") 复制
跨 35 种语言的人类生成标注助手对话语料
下载 16k · 收藏 1.5k · 3年前更新
- py from datasets import load_dataset
ds = load_dataset("OpenAssistant/oasst1") 复制
众包多语言助手指令对话集,含质量评分与毒性检测
下载 7.0k · 收藏 292 · 2年前更新
- 涵盖35种语言,包含完整对话树结构与角色标记
- 每条消息附带人工质量标签、毒性评分及emoji反馈
- 基于Apache-2.0许可,可直接用于商用模型微调或评测
为什么值得用作为开源社区活跃维护的多语言对齐数据集,适合快速验证模型指令跟随能力及多语言泛化性
- 原始数据未明确提供去重处理,重复或近似消息可能影响评测公平性
- 质量标签(quality)为单一维度的0-1分,无法覆盖更细粒度的意图/风格差异
- 毒性检测基于Detoxify模型输出,非人工校验,可能存在误标或偏见
- 语言分布极不均衡(英语占主体),多语言场景需注意采样偏差
- 训练集仅约12.8万条样本,体量中等,对大规模预训练支撑有限
- 众包标注存在噪声,尤其是低资源语言的质量标签稀疏
- 部分对话为合成数据(synthetic字段标记),需自行过滤或验证
- py from datasets import load_dataset
ds = load_dataset("OpenAssistant/oasst2") 复制
100B token合成混合,专为Olmo 3第二阶段退火训练设计,覆盖数学/代码/推理
下载 30k · 收藏 20 · 4个月前更新
- 由AllenAI为OLMo 3 32B中期训练筛选的高质量合成数据池,目标提升数学、代码、QA、指令理解与思考能力
- 包含12种以上不同来源的合成数据(如TinyMATH、CraneCode、Nemotron QA等),覆盖较广的技能维度
- 采用ODC-BY开源许可,可商用途经署名即可使用
为什么值得用若需要快速获取一批针对数学、代码、推理等能力的合成训练/微调样本,本数据集可直接加载text字段使用,无需额外清洗。
- 合成数据占比100%,存在模式化和伪相关风险,尤其数学和推理数据可能高度模板化
- 未公开去重策略及重复率,同一来源内部可能存在近重复样本
- 数据来源为多管道生成,噪声水平不一(如网络爬取部分经过STEM筛选,但合成QA质量依赖提示设计)
- 数据集曾用于Olmo 3训练,若直接用于评测存在潜在泄漏(需确认时间和任务范围)
- 全部为合成数据,缺乏自然文本多样性,在真实场景泛化上可能受限
- 仅包含英文,不支持多语言任务
- ODC-BY许可要求明确署名,需注意合规性
从 prompts.chat 平台收集的 AI 提示词数据集
下载 31k · 收藏 9.7k · 1个月前更新
- py from datasets import load_dataset
ds = load_dataset("fka/prompts.chat") 复制
基于84个CommonCrawl快照的百亿级多语言预训练语料,含质量信号与去重ID
下载 6.9k · 收藏 403 · 1年前更新
- 原始规模超过100B文档、100万亿tokens,覆盖5种主要欧洲语言
- 为30B文档提供了40+种预计算质量信号,支持按需过滤与加权
- 附带重复文档ID列表,可构建20B去重子集
为什么值得用作为公开可复现的大规模Web语料基座,配合质量信号可定制训练数据,适合需要灵活过滤与研究的团队
- 去重需自行利用提供的ID进行,HuggingFace加载的版本未做去重
- 数据来源为网络爬虫,存在领域偏差、内容重复及低质页面
- 质量信号虽丰富,但最优过滤规则取决于下游任务,没有通用方案
- 文档来自HTML转换,可能包含导航文本、广告等噪声,需额外清理
- 许可证标注为‘unknown’,使用前需自行评估版权与合规风险
- 原始数据未经清洗,直接用于训练会产生HTML伪影、低质内容等问题
- 完整下载需大量存储空间与带宽(数百TB级)
← 前一日 2026-06-20 · 后一日 2026-06-22 →