Anthropic / hh-rlhf
人类对有用性和无害性的偏好数据,用于RLHF训练。
下载 38k · 收藏 1.7k · 3年前更新
社区实测
作为早期大规模 RLHF 偏好数据集被广泛引用,但社区实测发现部分标注存在人工错误
- 提供 helpfulness 与 harmlessness 两个维度的人类偏好对比数据,用于 RLHF 对齐训练
- 人工标注存在错误,部分 rejected 回复实际质量优于 chosen 回复
来源
GitHub - anthropics/hh-rlhfAnthropic RLHF Dataset: Human Preference Data (+ errors I found) : r/datasets
截至 2026-06-20
- py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")