数据集 / 归档 / 2026-07-07

2026-07-07 数据集 (7)

WithinUsAI / claude_mythos_distilled_25k

模仿Claude Mythos的合成SFT数据集,涵盖网络安全等多个领域。

2.5万行 · 105 MB

  • 文本
  • apache-2.0 · 可商用

下载 3.9k · 收藏 143 · 2个月前更新

HF 安全扫描标记可疑 · VirusTotal 1/74· 低比例多为数据内含代码触发的误报,查看报告自行判断查看报告

  • py from datasets import load_dataset ds = load_dataset("WithinUsAI/claude_mythos_distilled_25k")

OpenOneRec / Explorer_LLM_Rec_Competition

包含用户历史行为与内容元数据的跨域推荐数据集。

17.2 GB

下载 18k · 收藏 13 · 20天前更新

wikimedia / wikipedia

维基百科清洗后的文章数据集,覆盖所有语言。

6161.5万行 · 1.4 TB

  • 文本
  • 文本生成
  • 掩码填充
  • cc-by-sa-3.0 · 可商用
  • 含中文

下载 197k · 收藏 1.3k · 2年前更新

  • py from datasets import load_dataset ds = load_dataset("wikimedia/wikipedia")

FreedomIntelligence / medical-o1-reasoning-SFT

基于可验证医疗问题的推理链SFT数据集,来自Deepseek-R1蒸馏。

9.0万行 · 680 MB

  • 文本
  • 问答
  • 文本生成
  • apache-2.0 · 可商用
  • 含中文

下载 11k · 收藏 1.1k · 1年前更新

  • py from datasets import load_dataset ds = load_dataset("FreedomIntelligence/medical-o1-reasoning-SFT")

HuggingFaceFW / fineweb-edu

从FineWeb中筛选的教育类网页数据集,使用LLM分类器。

34.97亿行 · 6.2 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 382k · 收藏 1.2k · 1年前更新

  • py from datasets import load_dataset ds = load_dataset("HuggingFaceFW/fineweb-edu")

gsdf / EasyNegative

用于Stable Diffusion的负面嵌入,基于Counterfeit模型训练。

3 行 · 3.9 GB

  • 图像
  • other · 待核

下载 19k · 收藏 1.2k · 3年前更新

  • py from datasets import load_dataset ds = load_dataset("gsdf/EasyNegative")

togethercomputer / RedPajama-Data-1T

完全开源的LLaMa数据集复现(RedPajama)。

172.6万行 · 39.5 GB

  • 文本
  • 文本生成

下载 2.1k · 收藏 1.2k · 2年前更新

  • py from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T")

← 前一日 2026-07-06 · 后一日 2026-07-08 →