数据集 / 归档 / 2026-05-23

2026-05-23 数据集 (8)

wikimedia / structured-wikipedia

英语和法语维基百科的结构化文章数据

1046.9万行 · 74.3 GB

  • 文本
  • cc-by-sa-4.0 · 可商用

下载 2.5k · 收藏 127 · 2个月前更新

社区实测

Wikipedia 结构化 JSON 数据集解决了原始 Wiki 文本难以直接用于 ML 管线的痛点,但目前仅覆盖英法两种语言,且 CC-BY-SA-4.0 许可对商用有约束。

  • Wikipedia 原始数据难以直接用于 ML 管线,该数据集提供结构化 JSON,省去抓取与解析的工程负担
  • Databricks 已用其 Structured Contents 端点将数百万维基百科条目批量转为 Markdown,跳过了正则解析层
  • 目前仅覆盖英语和法语,其他语言尚未纳入
  • 底层内容采用 CC-BY-SA-4.0 许可,衍生使用需以相同许可共享,对商用有约束
  • Wikimedia 平台曾因安全事件进入只读状态,数据可用性存在外部依赖风险

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("wikimedia/structured-wikipedia")

LukaDev13 / Liminal-Dreamcore-1K

AI生成的Dreamcore风格图像集合

0 行 · 359 MB

  • 图像
  • mit · 可商用

下载 2.4k · 收藏 18 · 2个月前更新

zhifeixie / Voices-in-the-Wild-2M

多声学条件下的自动语音识别数据

58.2万行 · 177.4 GB

  • 音频
  • 语音识别
  • 含中文

下载 5.1k · 收藏 17 · 2个月前更新

FreedomIntelligence / medical-o1-reasoning-SFT

基于医学可验证问题的推理链SFT数据

9.0万行 · 680 MB

  • 文本
  • 问答
  • 文本生成
  • apache-2.0 · 可商用
  • 含中文

下载 5.9k · 收藏 1.1k · 1年前更新

社区实测

GPT-4o 合成的医疗复杂推理 SFT 数据集,作为 HuatuoGPT-o1 项目阶段一训练数据开源,社区已有基于 QLoRA 的复现实践

  • 提供带复杂思维链(Complex CoT)的医疗推理训练样本,覆盖鉴别诊断等临床场景
  • 支持可复现的医疗领域监督微调,已有基于 Qwen3-8B + QLoRA 的完整微调流程
  • 数据完全由 GPT-4o 合成生成,非真实临床数据
  • 仅包含阶段一 SFT 数据,不包含后续 PPO 强化学习阶段所用的可验证问题与奖励数据

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("FreedomIntelligence/medical-o1-reasoning-SFT")

HuggingFaceFW / fineweb-edu

从网络过滤出的教育类网页文本数据

34.97亿行 · 6.2 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 616k · 收藏 1.1k · 1年前更新

社区实测

社区认可其构建流程的开放透明,脚本与数据均可复现,在同等规模数据集中表现领先

  • 提供了大规模高质量教育内容用于LLM预训练(1.3T tokens)
  • 公开了完整的构建流程与脚本,解决了预训练数据构建不透明的问题
  • 在同等规模数据集中预训练效果更优

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("HuggingFaceFW/fineweb-edu")

gsdf / EasyNegative

Stable Diffusion的负面嵌入

3 行 · 3.9 GB

  • 图像
  • other · 待核

下载 25k · 收藏 1.2k · 3年前更新

社区实测

社区公认它是 SD 1.5 生态里最常用的负向 Textual Inversion 之一,能有效抑制单色、重复纹理等常见崩坏,但与 SDXL 系模型不兼容且会明显改变画面风格。

  • 防止画面出现单色、重复图案和怪异输出
  • 作为 SD 1.5 通用的负向嵌入,降低反复手写负面 prompt 的负担
  • 仅适用于 SD 1.5,与 SDXL、Pony、Illustrious 等模型不兼容
  • 会显著改变画面整体风格,不是所有场景都适用
  • 对新手来说其具体作用机制不透明,容易误用

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("gsdf/EasyNegative")

togethercomputer / RedPajama-Data-1T

LLaMa数据集的完全开源复现

172.6万行 · 39.5 GB

  • 文本
  • 文本生成

下载 2.2k · 收藏 1.2k · 2年前更新

  • py from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T")

wikimedia / wikipedia

多语言维基百科清洗后的完整文章

6161.5万行 · 1.4 TB

  • 文本
  • 文本生成
  • 掩码填充
  • cc-by-sa-3.0 · 可商用
  • 含中文

下载 266k · 收藏 1.2k · 2年前更新

  • py from datasets import load_dataset ds = load_dataset("wikimedia/wikipedia")

← 前一日 2026-05-22 · 后一日 2026-05-24 →