FreedomIntelligence / medical-o1-reasoning-SFT
基于医学可验证问题的推理链SFT数据
下载 5.9k · 收藏 1.1k · 1年前更新
社区实测
GPT-4o 合成的医疗复杂推理 SFT 数据集,作为 HuatuoGPT-o1 项目阶段一训练数据开源,社区已有基于 QLoRA 的复现实践
- 提供带复杂思维链(Complex CoT)的医疗推理训练样本,覆盖鉴别诊断等临床场景
- 支持可复现的医疗领域监督微调,已有基于 Qwen3-8B + QLoRA 的完整微调流程
- 数据完全由 GPT-4o 合成生成,非真实临床数据
- 仅包含阶段一 SFT 数据,不包含后续 PPO 强化学习阶段所用的可验证问题与奖励数据
截至 2026-06-20
- py from datasets import load_dataset ds = load_dataset("FreedomIntelligence/medical-o1-reasoning-SFT")