SummFlow 2026-05-22 Hugging Face

HuggingFaceBio / carbon-pretraining-corpus

DNA和RNA序列的基因组预训练语料,覆盖真核与原核物种。

1.80亿行 · 1.3 TB

  • 多模态
  • 文本生成
  • other · 待核

下载 2.9k · 收藏 17 · 2个月前更新

  • py from datasets import load_dataset ds = load_dataset("HuggingFaceBio/carbon-pretraining-corpus")

Anthropic / hh-rlhf

人类对有用性和无害性的偏好数据,用于RLHF训练。

16.9万行 · 4.1 GB

  • 文本
  • mit · 可商用

下载 38k · 收藏 1.7k · 3年前更新

社区实测

作为早期大规模 RLHF 偏好数据集被广泛引用,但社区实测发现部分标注存在人工错误

  • 提供 helpfulness 与 harmlessness 两个维度的人类偏好对比数据,用于 RLHF 对齐训练
  • 人工标注存在错误,部分 rejected 回复实际质量优于 chosen 回复

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Anthropic/hh-rlhf")

fka / prompts.chat

社区分享的AI提示词数据集。

1,823 行 · 29 MB

  • 文本
  • 问答
  • 文本生成
  • cc0-1.0 · 可商用

下载 53k · 收藏 9.7k · 2个月前更新

社区实测

由 awesome-chatgpt-prompts 演进而来的开源提示词集合,社区视其为从静态列表升级为可自托管工具的延续

  • 提供免费、开源、可自托管的提示词收集与分享工具
  • 以 Hugging Face 数据集形式提供,便于程序化访问与集成
  • 从原有 awesome-chatgpt-prompts 仓库升级为端到端工具
  • 提示词内容存在持续增删维护,部分旧提示词被移除或改写,稳定性一般

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("fka/prompts.chat")