SummFlow 2026-05-22 Hugging Face

Open-Orca / OpenOrca

增强的FLAN数据集,用于训练对话模型。

294.2万行 · 63.5 GB

  • 文本
  • 文本分类
  • 序列标注
  • 表格问答
  • mit · 可商用

下载 50k · 收藏 1.5k · 1年前更新

社区实测

OpenOrca 试图以开源方式复现 Orca 论文的 GPT-4 推理数据构造方法,社区反馈模型效果不错但存在身份幻觉——模型会误以为自己是 ChatGPT。

  • 以开源方式复现了 Orca 论文的数据收集方法,让开源模型能学习 GPT-4 的推理模式
  • 推动更小、更快、更聪明的开源模型开发
  • 用该数据集训练的模型可能出现身份幻觉,自称是 OpenAI 开发的 ChatGPT

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Open-Orca/OpenOrca")