数据集 / 归档 / 2026-06-11

2026-06-11 数据集 (4)

agents-last-exam / agents-last-exam

面向长周期专业工作的计算机使用代理评估基准的任务元数据

149 行 · 988 KB

  • 文本
  • cc-by-4.0 · 可商用

下载 787 · 收藏 139 · 1个月前更新

社区实测

ALE 是一个仍在建设中的开放基准,由 Berkeley RDI 联合 300+ 行业专家构建,旨在用真实经济价值任务替代抽象代理评测,但当前前沿智能体在最难层级仅通过 2.6%,社区独立验证尚缺。

  • 将 AI 智能体评测从抽象代理问题转向长周期、有经济价值的真实工作流
  • 提供开源沙箱执行环境(ale_run)与 150 个公开参考任务,可复现验证
  • 覆盖 55 个子行业,是目前覆盖面最广的智能体评测基准之一
  • 基准仍在建设中,当前 1,500+ 任务距 5,000 目标差距较大,公开可用的参考任务仅 150 个
  • 最难的 last-exam 层级通过率仅 2.6%,任务难度可能远超当前能力或标定有待验证
  • 缺乏独立第三方复现或社区广泛采用的证据,生态成熟度未知

截至 2026-06-20

  • py from datasets import load_dataset ds = load_dataset("agents-last-exam/agents-last-exam")

ServiceNow-AI / eva-bench

对话语音代理端到端评估框架,基于机器人间音频对话评分

213 行 · 10 MB

  • 文本
  • 文本生成
  • other
  • mit · 可商用

下载 111 · 收藏 22 · 2个月前更新

  • py from datasets import load_dataset ds = load_dataset("ServiceNow-AI/eva-bench")

zhifeixie / StreamAudio-2M

用于音频大模型与代理训练的流式音频数据集,含六个任务子集

38.1万行 · 759.9 GB

  • 多模态
  • 音频分类
  • 语音识别
  • 翻译
  • cc-by-4.0 · 可商用
  • 含中文

下载 1.7k · 收藏 21 · 1个月前更新

  • py from datasets import load_dataset ds = load_dataset("zhifeixie/StreamAudio-2M")

MEDHARVIX-SYSTEMS / bhasaflow-khasi-english-parallel-sample-v1

Khasi语-英语平行语音与文本语料样本

0 行 · 22 MB

  • 语音识别
  • 语音合成
  • 翻译
  • other · 待核

下载 2.1k · 收藏 22 · 2个月前更新

社区实测

一个面向低资源语言 Khasi 的专业策展平行语料库公开样本,但仅 100 句对、完整语料需申请授权,实际可复现性因数据集查看器损坏而受限

  • 为 Khasi 语 ASR/TTS/机器翻译提供稀缺的平行语音-文本对齐数据
  • 为低资源语言研究提供格式规范、经过多阶段人工质检的基准评估样本
  • 许可为 restricted/other:公开样本仅限非商业研究使用,禁止再分发,商用需单独授权
  • 数据集查看器已损坏,audio_412.wav 等音频文件无法加载,影响在线预览与快速评估
  • 公开样本仅 100 句对,不足以直接用于模型训练,完整语料需走审批流程获取
  • 说话人方言覆盖有限,当前样本可能未充分代表 Khasi 语内部方言差异

截至 2026-06-20

← 前一日 2026-06-10 · 后一日 2026-06-12 →