SummFlow 2026-06-11 Hugging Face

agents-last-exam / agents-last-exam

面向长周期专业工作的计算机使用代理评估基准的任务元数据

149 行 · 988 KB

  • 文本
  • cc-by-4.0 · 可商用

下载 787 · 收藏 139 · 1个月前更新

社区实测

ALE 是一个仍在建设中的开放基准,由 Berkeley RDI 联合 300+ 行业专家构建,旨在用真实经济价值任务替代抽象代理评测,但当前前沿智能体在最难层级仅通过 2.6%,社区独立验证尚缺。

  • 将 AI 智能体评测从抽象代理问题转向长周期、有经济价值的真实工作流
  • 提供开源沙箱执行环境(ale_run)与 150 个公开参考任务,可复现验证
  • 覆盖 55 个子行业,是目前覆盖面最广的智能体评测基准之一
  • 基准仍在建设中,当前 1,500+ 任务距 5,000 目标差距较大,公开可用的参考任务仅 150 个
  • 最难的 last-exam 层级通过率仅 2.6%,任务难度可能远超当前能力或标定有待验证
  • 缺乏独立第三方复现或社区广泛采用的证据,生态成熟度未知

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("agents-last-exam/agents-last-exam")