Anthropic / hh-rlhf
人类偏好数据,用于RLHF训练帮助性和无害性
下载 37k · 收藏 1.8k · 3年前更新
社区实测
作为 RLHF 早期开源基准被广泛引用,但社区实际使用中发现标注质量参差不齐,部分样本的偏好标签存在明显错误。
- 提供大规模人类偏好数据用于安全对齐(safety-focused alignment)训练
- 数据格式简单(每行一对 chosen/rejected 文本),可直接用于偏好模型训练
- 提供 train/test 划分,方便复现评估
- 标注存在噪声:部分样本中 rejected 回复质量实际优于 chosen 回复,可能是人工标注失误所致
来源
GitHub - anthropics/hh-rlhfRLHF-Aligned Open LLMs: A Comparative Survey - Preprints.orgAnthropic RLHF Dataset: Human Preference Data (+ errors I found)
截至 2026-06-20
- py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")