SummFlow 2026-05-20 Hugging Face

PsiBotAI / SynData

涵盖视觉、语言和动作的多模态人类数据,用于具身智能训练。

44.9万行 · 29.4 TB

  • 多模态
  • cc-by-4.0 · 可商用

下载 36k · 收藏 146 · 2个月前更新

  • py from datasets import load_dataset ds = load_dataset("PsiBotAI/SynData")

AlienKevin / SWE-ZERO-12M-trajectories

编码智能体轨迹数据,覆盖16种编程语言和3K个仓库。

1229.1万行 · 199.4 GB

  • 文本
  • 文本生成
  • apache-2.0 · 可商用

下载 7.6k · 收藏 85 · 2个月前更新

社区实测

当前规模最大的开放 agentic SWE 轨迹数据集,社区认可其填补了免执行训练数据的空白,但轨迹质量受限于生成模型能力。

  • 免执行(execution-free)的 SWE 训练数据管线,绕开容器化验证的 Docker 瓶颈
  • 将 SWE-ZERO 数据规模从 9B tokens 扩展到 112B tokens,提供 12M 条轨迹
  • 轨迹由 1.7B 小模型 mini-coder-1.7b 采样生成,轨迹质量上限受生成模型能力制约
  • 在 SWE-bench Verified 上训练验证的基线得分较低(10 万条轨迹仅 5.3%±1.5),大规模训练效果尚待验证
  • 全量数据集 112B tokens 远超已验证的约 1B tokens 训练规模,扩展有效性未经充分证实

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("AlienKevin/SWE-ZERO-12M-trajectories")

angrygiraffe / claude-opus-4.6-4.7-reasoning-8.7k

Claude生成的合成思维链推理数据。

495 MB

  • 文本
  • 10K–100K
  • 文本生成
  • 问答
  • apache-2.0 · 可商用

下载 3.2k · 收藏 147 · 2个月前更新

社区实测

全量合成、创建者未审查的 Claude 推理对话数据集,社区讨论集中在源模型质量而非数据集本身

  • 提供 8706 条带推理链的合成对话样本,面向推理能力微调场景
  • 创建者明确表示未审查数据(I haven't reviewed the data),数据质量与正确性无保证
  • 全量合成数据,无人工筛选、去重或标注质量说明

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("angrygiraffe/claude-opus-4.6-4.7-reasoning-8.7k")