SummFlow 2026-05-23 Hugging Face

FreedomIntelligence / medical-o1-reasoning-SFT

基于医学可验证问题的推理链SFT数据

9.0万行 · 680 MB

  • 文本
  • 问答
  • 文本生成
  • apache-2.0 · 可商用
  • 含中文

下载 5.9k · 收藏 1.1k · 1年前更新

社区实测

GPT-4o 合成的医疗复杂推理 SFT 数据集,作为 HuatuoGPT-o1 项目阶段一训练数据开源,社区已有基于 QLoRA 的复现实践

  • 提供带复杂思维链(Complex CoT)的医疗推理训练样本,覆盖鉴别诊断等临床场景
  • 支持可复现的医疗领域监督微调,已有基于 Qwen3-8B + QLoRA 的完整微调流程
  • 数据完全由 GPT-4o 合成生成,非真实临床数据
  • 仅包含阶段一 SFT 数据,不包含后续 PPO 强化学习阶段所用的可验证问题与奖励数据

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("FreedomIntelligence/medical-o1-reasoning-SFT")

gsdf / EasyNegative

Stable Diffusion的负面嵌入

3 行 · 3.9 GB

  • 图像
  • other · 待核

下载 25k · 收藏 1.2k · 3年前更新

社区实测

社区公认它是 SD 1.5 生态里最常用的负向 Textual Inversion 之一,能有效抑制单色、重复纹理等常见崩坏,但与 SDXL 系模型不兼容且会明显改变画面风格。

  • 防止画面出现单色、重复图案和怪异输出
  • 作为 SD 1.5 通用的负向嵌入,降低反复手写负面 prompt 的负担
  • 仅适用于 SD 1.5,与 SDXL、Pony、Illustrious 等模型不兼容
  • 会显著改变画面整体风格,不是所有场景都适用
  • 对新手来说其具体作用机制不透明,容易误用

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("gsdf/EasyNegative")

HuggingFaceFW / fineweb-edu

从网络过滤出的教育类网页文本数据

34.97亿行 · 6.2 TB

  • 多模态
  • 文本生成
  • odc-by · 可商用

下载 616k · 收藏 1.1k · 1年前更新

社区实测

社区认可其构建流程的开放透明,脚本与数据均可复现,在同等规模数据集中表现领先

  • 提供了大规模高质量教育内容用于LLM预训练(1.3T tokens)
  • 公开了完整的构建流程与脚本,解决了预训练数据构建不透明的问题
  • 在同等规模数据集中预训练效果更优

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("HuggingFaceFW/fineweb-edu")