agents-last-exam / agents-last-exam
面向长周期专业工作的计算机使用代理评估基准的任务元数据
下载 787 · 收藏 139 · 1个月前更新
社区实测
ALE 是一个仍在建设中的开放基准,由 Berkeley RDI 联合 300+ 行业专家构建,旨在用真实经济价值任务替代抽象代理评测,但当前前沿智能体在最难层级仅通过 2.6%,社区独立验证尚缺。
- 将 AI 智能体评测从抽象代理问题转向长周期、有经济价值的真实工作流
- 提供开源沙箱执行环境(ale_run)与 150 个公开参考任务,可复现验证
- 覆盖 55 个子行业,是目前覆盖面最广的智能体评测基准之一
- 基准仍在建设中,当前 1,500+ 任务距 5,000 目标差距较大,公开可用的参考任务仅 150 个
- 最难的 last-exam 层级通过率仅 2.6%,任务难度可能远超当前能力或标定有待验证
- 缺乏独立第三方复现或社区广泛采用的证据,生态成熟度未知
Agents' Last Exam launches economically focused agent benchmark | Let's Data Sciencerdi-berkeley/agents-last-exam - GitHubAI Agent Benchmark for Real-World Professional Workflows
截至 2026-06-20
- py from datasets import load_dataset ds = load_dataset("agents-last-exam/agents-last-exam")