数据集 / nvidia / Nemotron-Pretraining-Code-v3

nvidia / Nemotron-Pretraining-Code-v3

包含源代码元数据的预训练数据集,用于提升 LLM 编程能力

作者
nvidia
规模
1.46亿行 · 1.2 GB
模态
文本
任务
文本生成
授权
cc-by-4.0 · 可商用
语种
code
下载
338
收藏
31
  • pyfrom datasets import load_dataset ds = load_dataset("nvidia/Nemotron-Pretraining-Code-v3")

观测时间线