数据集 / 归档 / 2026-06-05

2026-06-05 数据集 (5)

Jackrong / GLM-5.1-Reasoning-1M-Cleaned

GLM-5.1生成的多领域推理数据,清理为SFT格式,含四个子集

57.2万行 · 44.2 GB

  • 文本
  • 文本生成
  • 问答
  • apache-2.0 · 可商用
  • 含中文

下载 9.8k · 收藏 252 · 3个月前更新

社区实测

该数据集虽标注为 Cleaned,但实际样本中仍存在明显的文本重复与多段拼接问题,清洗程度有限。

  • 提供了 GLM-5.1 推理轨迹的公开可访问快照,便于社区检查数据质量与训练样本形态。
  • 单条样本内存在同一问题多次重复出现的情况
  • 多条不相关的 prompt 被拼接在同一个训练条目中,未完全拆分
  • 样本中混杂英文与西班牙语等多语言内容,来源一致性存疑

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("Jackrong/GLM-5.1-Reasoning-1M-Cleaned")

nvidia / PhysicalAI-WorldModel-Synthetic-Digital-Human-Scenes

合成数字人类在3D室内外场景的长视频数据集,用于世界模型训练

0 行 · 172.7 TB

  • 视频
  • other · 待核

下载 3.9k · 收藏 22 · 1个月前更新

minhxthanh / Vietnam-History-1M-Vi

越南历史问答对话数据集,包含推理链和直接回答

100.0万行 · 942 MB

  • 文本
  • 问答
  • 文本生成
  • mit · 可商用

下载 116 · 收藏 21 · 10个月前更新

  • py from datasets import load_dataset ds = load_dataset("minhxthanh/Vietnam-History-1M-Vi")

WithinUsAI / claude_mythos_distilled_25k

模仿Claude Mythos模型的合成SFT数据集,覆盖网络安全等技术领域

2.5万行 · 105 MB

  • 文本
  • apache-2.0 · 可商用

下载 627 · 收藏 29 · 2个月前更新

HF 安全扫描标记可疑 · VirusTotal 1/74· 低比例多为数据内含代码触发的误报,查看报告自行判断查看报告

  • py from datasets import load_dataset ds = load_dataset("WithinUsAI/claude_mythos_distilled_25k")

openai / gsm8k

小学算术应用题,需多步推理

1.8万行 · 12 MB

  • 文本
  • 文本生成
  • mit · 可商用

下载 948k · 收藏 1.4k · 4个月前更新

社区实测

GSM8K 是评估大模型多步算术推理的事实标准基准,被 OpenAI、Google 等主流实验室广泛采用,以精确匹配评分和思维链评估见长。

  • 提供标准化的多步算术推理评测,问题对人类简单但对模型有挑战性,形成有效的能力区分
  • 精确匹配评分机制使模型间对比和错误诊断直观可操作
  • 已被 Google PaLM、Chain of Thought 等关键工作采用,成为跨实验室模型对比的共同标尺
  • 传统的结果导向评分可能忽略推理过程质量,MR-GSM8K 研究指出仅看最终答案不足以区分模型的认知能力差异
  • 问题限定在小学数学范围(2–8 步、基本四则运算),无法评估更复杂的数学推理能力

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("openai/gsm8k")

← 前一日 2026-06-04 · 后一日 2026-06-06 →