数据集 / 归档 / 2026-06-07

2026-06-07 数据集 (7)

wikimedia / structured-wikipedia

英语和法语维基百科文章的结构化解析数据

1046.9万行 · 74.3 GB

  • 文本
  • cc-by-sa-4.0 · 可商用

下载 11k · 收藏 305 · 2个月前更新

社区实测

Hugging Face 上由 Wikimedia 官方维护的结构化 Wikipedia 快照,提供解析好的信息框、章节和 Wikidata 实体链接,省去 wikitext 解析,适合离线分析与社区复用,但需注意 CC-BY-SA-4.0 的衍生合规要求。

  • 无需自行解析 wikitext,直接获取结构化 Wikipedia 内容(信息框、章节、Wikidata 实体链接),跳过正则解析层
  • 提供定期刷新的 Wikipedia 快照,支持社区复用与大规模离线分析
  • CC-BY-SA-4.0 许可证要求署名和相同方式共享,衍生数据集或商用场景需评估合规风险
  • Wikimedia 基础设施偶发安全事件(如恶意脚本导致全站只读)可能造成数据更新中断

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("wikimedia/structured-wikipedia")

HuggingFaceFW / fineweb-edu

经教育质量分类器筛选的网页文本数据集

34.97亿行 · 6.2 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 506k · 收藏 1.1k · 1年前更新

社区实测

社区认可其开放透明(脚本完整公开)与教育子集的高质量,认为技术报告为预训练数据构建提供了宝贵参考

  • 预训练数据构建过程不透明:多数大模型厂商不公开数据细节,该数据集完整公开了所有处理脚本
  • 大规模高质量开源预训练数据的获取:15万亿token规模且质量超越同类数据集

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("HuggingFaceFW/fineweb-edu")

openbmb / Ultra-FineWeb

经验证过滤的高质量中英文网络文本数据集

12.90亿行 · 9.7 TB

  • 文本
  • 文本生成
  • apache-2.0 · 可商用
  • 含中文

下载 99k · 收藏 372 · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("openbmb/Ultra-FineWeb")

FreedomIntelligence / medical-o1-reasoning-SFT

基于医疗问题的推理链监督微调数据集

9.0万行 · 680 MB

  • 文本
  • 问答
  • 文本生成
  • apache-2.0 · 可商用
  • 含中文

下载 6.9k · 收藏 1.1k · 1年前更新

社区实测

HuatuoGPT-o1 的 SFT 训练数据集,由 GPT-4o 生成的带复杂思维链的医疗问答题,Apache 2.0 许可,社区主要将其用于医疗 LLM 推理能力微调。

  • 医疗推理 SFT 训练数据开源,附带 GPT-4o 生成的复杂思维链(Complex CoT)与答案
  • Apache 2.0 许可,允许商用
  • 中英双语医疗问答覆盖(en/zh 各约 2 万条)
  • 数据完全由 GPT-4o 合成生成,推理质量与医学准确性受限于生成模型,未经人工校验的合成数据可能包含幻觉或错误推理

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("FreedomIntelligence/medical-o1-reasoning-SFT")

gsdf / EasyNegative

针对Stable Diffusion的负面嵌入向量文件

3 行 · 3.9 GB

  • 图像
  • other · 待核

下载 30k · 收藏 1.2k · 3年前更新

社区实测

SD 1.5 生态中广泛使用的负向嵌入,对抑制单色、重复图案有效,但与 SDXL/Pony/Illustrious 不兼容且会大幅改变画面风格。

  • 抑制单色、重复图案及怪异输出,减少画面出现灰度化或纹理重复的问题
  • 仅适用于 SD 1.5 模型,与 SDXL、Pony、Illustrious 等模型不兼容,强行使用无效
  • 可能大幅改变画面整体风格,并非所有场景都适合无脑加入

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("gsdf/EasyNegative")

togethercomputer / RedPajama-Data-1T

遵循LLaMA数据集格式的开源文本数据

172.6万行 · 39.5 GB

  • 文本
  • 文本生成

下载 2.4k · 收藏 1.2k · 2年前更新

社区实测

RedPajama-1T是LLaMA训练数据配方的早期开源复现,已被RedPajama-V2取代

  • 原始web数据存在HTML转文本伪影、低质量来源和内容偏差,不宜直接用于LLM训练
  • 已被RedPajama-V2取代,v2提供30T token、40+预计算质量标注和去重,RPv1代码已归档至rp_v1分支

截至 2026-06-20

已被取代 RedPajama-Data-V2 · V2 将规模从 1.2T 扩展到 30T tokens,覆盖 84 个 CommonCrawl 快照,是官方推荐的后续版本

  • py from datasets import load_dataset ds = load_dataset("togethercomputer/RedPajama-Data-1T")

wikimedia / wikipedia

包含所有语言已清理的维基百科文章

6161.5万行 · 1.4 TB

  • 文本
  • 文本生成
  • 掩码填充
  • cc-by-sa-3.0 · 可商用
  • 含中文

下载 224k · 收藏 1.2k · 2年前更新

社区实测

Wikipedia 被社区视为不可或缺的公共知识基础设施,界面干净无广告追踪,但面临 AI 摘要导致的流量下滑和偶发的安全事件挑战。

  • 提供无广告、无追踪、无恶意软件的干净信息获取体验
  • 作为免费公共知识资源向所有人开放
  • 曾因恶意用户脚本导致全站只读锁定,存在账户安全与自动化恶意编辑风险
  • AI 搜索摘要正在减少 Wikipedia 的直接访问流量

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("wikimedia/wikipedia")

← 前一日 2026-06-06 · 后一日 2026-06-08 →