数据集 / Anthropic / hh-rlhf

Anthropic / hh-rlhf

人类偏好数据,用于训练帮助性和无害性奖励模型

作者
Anthropic
规模
16.9万行 · 4.1 GB
模态
文本
授权
mit · 可商用
下载
31,951
收藏
1,832

社区实测

作为 RLHF 早期开源基准被广泛引用,但社区实际使用中发现标注质量参差不齐,部分样本的偏好标签存在明显错误。

  • 提供大规模人类偏好数据用于安全对齐(safety-focused alignment)训练
  • 数据格式简单(每行一对 chosen/rejected 文本),可直接用于偏好模型训练
  • 提供 train/test 划分,方便复现评估
  • 标注存在噪声:部分样本中 rejected 回复质量实际优于 chosen 回复,可能是人工标注失误所致

截至 2026-06-20

  • pyfrom datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")

观测时间线