数据集 / HuggingFaceBio / carbon-pretraining-corpus

HuggingFaceBio / carbon-pretraining-corpus

DNA和RNA序列的基因组预训练语料,覆盖真核与原核物种。

作者
HuggingFaceBio
规模
1.80亿行 · 1.3 TB
模态
多模态
任务
文本生成
授权
other · 待核
下载
2,856
收藏
17
  • pyfrom datasets import load_dataset ds = load_dataset("HuggingFaceBio/carbon-pretraining-corpus")

观测时间线