OpenAssistant / oasst2
众包多语言助手指令对话集,含质量评分与毒性检测
- 涵盖35种语言,包含完整对话树结构与角色标记
- 每条消息附带人工质量标签、毒性评分及emoji反馈
- 基于Apache-2.0许可,可直接用于商用模型微调或评测
为什么值得用作为开源社区活跃维护的多语言对齐数据集,适合快速验证模型指令跟随能力及多语言泛化性
- 原始数据未明确提供去重处理,重复或近似消息可能影响评测公平性
- 质量标签(quality)为单一维度的0-1分,无法覆盖更细粒度的意图/风格差异
- 毒性检测基于Detoxify模型输出,非人工校验,可能存在误标或偏见
- 语言分布极不均衡(英语占主体),多语言场景需注意采样偏差
- 训练集仅约12.8万条样本,体量中等,对大规模预训练支撑有限
- 众包标注存在噪声,尤其是低资源语言的质量标签稀疏
- 部分对话为合成数据(synthetic字段标记),需自行过滤或验证
- pyfrom datasets import load_dataset ds = load_dataset("OpenAssistant/oasst2")