数据集 / 归档 / 2026-06-22

2026-06-22 数据集 (7)

WithinUsAI / claude_mythos_distilled_25k

合成SFT数据集,训练LLM模仿Claude Mythos的推理与行为

2.5万行 · 105 MB

  • 文本
  • apache-2.0 · 可商用

下载 2.5k · 收藏 105 · 2个月前更新

HF 安全扫描标记可疑 · VirusTotal 1/74· 低比例多为数据内含代码触发的误报,查看报告自行判断查看报告

  • py from datasets import load_dataset ds = load_dataset("WithinUsAI/claude_mythos_distilled_25k")

MiG-NJU / OmniVideo-100K

视频指令微调数据集,用于音视频推理任务

20.0万行 · 52.8 GB

  • 多模态
  • video-text-to-text
  • apache-2.0 · 可商用

下载 1.6k · 收藏 14 · 1个月前更新

FreedomIntelligence / medical-o1-reasoning-SFT

医疗推理SFT数据集,蒸馏自Deepseek-R1

9.0万行 · 680 MB

  • 文本
  • 问答
  • 文本生成
  • apache-2.0 · 可商用
  • 含中文

下载 10k · 收藏 1.1k · 1年前更新

  • py from datasets import load_dataset ds = load_dataset("FreedomIntelligence/medical-o1-reasoning-SFT")

HuggingFaceFW / fineweb-edu

教育过滤的网页文本数据集,基于FineWeb

34.97亿行 · 6.2 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 418k · 收藏 1.2k · 1年前更新

  • py from datasets import load_dataset ds = load_dataset("HuggingFaceFW/fineweb-edu")

gsdf / EasyNegative

Stable Diffusion的负面嵌入,用于生成过滤

3 行 · 3.9 GB

  • 图像
  • other · 待核

下载 25k · 收藏 1.2k · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("gsdf/EasyNegative")

togethercomputer / RedPajama-Data-1T

开源复现的LLaMa训练数据集

172.6万行 · 39.5 GB

  • 文本
  • 文本生成

下载 2.3k · 收藏 1.2k · 2年前更新

  • py from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T")

wikimedia / wikipedia

多语言维基百科文章清理版,每篇为一个样本

6161.5万行 · 1.4 TB

  • 文本
  • 文本生成
  • 掩码填充
  • cc-by-sa-3.0 · 可商用
  • 含中文

下载 155k · 收藏 1.3k · 2年前更新

  • py from datasets import load_dataset ds = load_dataset("wikimedia/wikipedia")

← 前一日 2026-06-21 · 后一日 2026-06-23 →