SummFlow 2026-05-22 Hugging Face

HuggingFaceBio / carbon-pretraining-corpus

DNA和RNA序列的基因组预训练语料,覆盖真核与原核物种。

1.80亿行 · 1.3 TB

  • 多模态
  • 文本生成
  • other · 待核

下载 2.9k · 收藏 17 · 2个月前更新

  • py from datasets import load_dataset ds = load_dataset("HuggingFaceBio/carbon-pretraining-corpus")