数据集 / Open-Orca / OpenOrca

Open-Orca / OpenOrca

增强的FLAN指令数据集,用于对齐训练

作者
Open-Orca
规模
294.2万行 · 63.5 GB
模态
文本
任务
文本分类 / 序列标注 / 表格问答 / 问答 / 零样本分类 / 摘要 / 特征提取 / 文本生成
授权
mit · 可商用
语种
en
下载
16,550
收藏
1,571

社区实测

OpenOrca 是微软 Orca 论文思路的开源复现,用 GPT-4 生成指令数据训练小模型,社区反馈模型能力有提升但会「以为自己是 ChatGPT」。

  • 提供了一套可公开获取的 GPT-4 质量指令微调数据,降低复现 Orca 方法的门槛
  • 使较小参数量的开源模型在推理任务上获得可感知的提升
  • 作为基座数据与其他模型(如 Platypus2、OpenChat)合并后能产生优于各自单独使用的效果
  • 用该数据集训练的模型可能产生身份混淆,自称 ChatGPT 或表现出「妄想」行为

截至 2026-06-20

  • pyfrom datasets import load_dataset ds = load_dataset("Open-Orca/OpenOrca")

观测时间线