Kwai-Klear / GoLongRL面向长上下文语言模型的强化学习训练数据,含9种奖励函数作者Kwai-Klear规模2.3万行 · 2.7 GB模态文本下载484收藏16pyfrom datasets import load_dataset ds = load_dataset("Kwai-Klear/GoLongRL")复制观测时间线2026-05-26 · 当日卡片 →