SummFlow 2026-06-05 Hugging Face

openai / gsm8k

小学算术应用题,需多步推理

1.8万行 · 12 MB

  • 文本
  • 文本生成
  • mit · 可商用

下载 948k · 收藏 1.4k · 4个月前更新

社区实测

GSM8K 是评估大模型多步算术推理的事实标准基准,被 OpenAI、Google 等主流实验室广泛采用,以精确匹配评分和思维链评估见长。

  • 提供标准化的多步算术推理评测,问题对人类简单但对模型有挑战性,形成有效的能力区分
  • 精确匹配评分机制使模型间对比和错误诊断直观可操作
  • 已被 Google PaLM、Chain of Thought 等关键工作采用,成为跨实验室模型对比的共同标尺
  • 传统的结果导向评分可能忽略推理过程质量,MR-GSM8K 研究指出仅看最终答案不足以区分模型的认知能力差异
  • 问题限定在小学数学范围(2–8 步、基本四则运算),无法评估更复杂的数学推理能力

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("openai/gsm8k")

WithinUsAI / claude_mythos_distilled_25k

模仿Claude Mythos模型的合成SFT数据集,覆盖网络安全等技术领域

2.5万行 · 105 MB

  • 文本
  • apache-2.0 · 可商用

下载 627 · 收藏 29 · 2个月前更新

HF 安全扫描标记可疑 · VirusTotal 1/74· 低比例多为数据内含代码触发的误报,查看报告自行判断查看报告

  • py from datasets import load_dataset ds = load_dataset("WithinUsAI/claude_mythos_distilled_25k")