SummFlow 2026-06-06 Hugging Face

Anthropic / hh-rlhf

人类偏好数据,用于RLHF训练帮助性和无害性

16.9万行 · 4.1 GB

  • 文本
  • mit · 可商用

下载 37k · 收藏 1.8k · 3年前更新

社区实测

作为 RLHF 早期开源基准被广泛引用,但社区实际使用中发现标注质量参差不齐,部分样本的偏好标签存在明显错误。

  • 提供大规模人类偏好数据用于安全对齐(safety-focused alignment)训练
  • 数据格式简单(每行一对 chosen/rejected 文本),可直接用于偏好模型训练
  • 提供 train/test 划分,方便复现评估
  • 标注存在噪声:部分样本中 rejected 回复质量实际优于 chosen 回复,可能是人工标注失误所致

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")