SummFlow 2026-06-09 Hugging Face

nvidia / Nemotron-Pretraining-Code-v3

包含源代码元数据的预训练数据集,用于提升 LLM 编程能力

1.46亿行 · 1.2 GB

  • 文本
  • 文本生成
  • cc-by-4.0 · 可商用

下载 338 · 收藏 31 · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("nvidia/Nemotron-Pretraining-Code-v3")