ginigen-ai / Metacognition-Bench评估大语言模型检测与纠正自身推理错误的元认知基准作者ginigen-ai规模300 行 · 197 KB模态文本任务文本生成 / 问答授权apache-2.0 · 可商用语种en下载78收藏19pyfrom datasets import load_dataset ds = load_dataset("ginigen-ai/Metacognition-Bench")复制观测时间线2026-07-02 · 当日卡片 →