SummFlow 2026-05-22 Hugging Face

Anthropic / hh-rlhf

人类对有用性和无害性的偏好数据,用于RLHF训练。

16.9万行 · 4.1 GB

  • 文本
  • mit · 可商用

下载 38k · 收藏 1.7k · 3年前更新

社区实测

作为早期大规模 RLHF 偏好数据集被广泛引用,但社区实测发现部分标注存在人工错误

  • 提供 helpfulness 与 harmlessness 两个维度的人类偏好对比数据,用于 RLHF 对齐训练
  • 人工标注存在错误,部分 rejected 回复实际质量优于 chosen 回复

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")