Jackrong / GLM-5.1-Reasoning-1M-Cleaned
GLM-5.1生成的多领域推理数据,清理为SFT格式,含四个子集
社区实测
该数据集虽标注为 Cleaned,但实际样本中仍存在明显的文本重复与多段拼接问题,清洗程度有限。
- 提供了 GLM-5.1 推理轨迹的公开可访问快照,便于社区检查数据质量与训练样本形态。
- 单条样本内存在同一问题多次重复出现的情况
- 多条不相关的 prompt 被拼接在同一个训练条目中,未完全拆分
- 样本中混杂英文与西班牙语等多语言内容,来源一致性存疑
来源
Jackrong/GLM-5.1-Reasoning-1M-Cleaned · Datasets at Hugging FaceJackrong/GLM-5.1-Reasoning-1M-Cleaned · Datasets at Hugging Face
截至 2026-06-20
- pyfrom datasets import load_dataset ds = load_dataset("Jackrong/GLM-5.1-Reasoning-1M-Cleaned")