数据集 / HuggingFaceBio / carbon-pretraining-corpus

HuggingFaceBio / carbon-pretraining-corpus

DNA和RNA序列的基因组预训练语料,覆盖真核与原核物种。

HF 源仓库 ↗本站资料更新 2026-05-22

关键规格

作者
HuggingFaceBio
规模
1.80亿行 · 1.3 TB
模态
文本
任务
文本生成
授权
other · 许可待核
HF 热度2,856 下载 · 17 收藏观测于 2026-05-22
源仓库更新2026-05-14

仓库许可不等于数据内容权利已全部清理,商用仍需核对数据来源、隐私与版权条款。

采用判断

项目方资料核对 · 1 个来源 · 核验于 2026-07-22

该数据集以真核生物序列为主,非真核支系覆盖不足,采用前需评估目标生物类群是否匹配。[1]

采用前注意

  • Carbon-3B 的预训练语料以真核生物基因组与转录组序列为主,原核生物、古菌等非真核支系的代表性偏低,在非真核任务上泛化能力可能受限。[1]

本段综合依据

  1. HuggingFaceBio/Carbon-3B ↗huggingface.co

历史记录

1 次历史卡片 · 2026-05-22