SummFlow 2026-06-25 Hugging Face

Qwen / AgentWorldBench

评估语言世界模型的基准,数据来自真实环境轨迹与地面真值。

2,170 行 · 0 B

  • 多模态
  • 文本生成
  • apache-2.0 · 可商用

下载 87 · 收藏 17 · 27天前更新

  • py from datasets import load_dataset ds = load_dataset("Qwen/AgentWorldBench")

allenai / olmOCR-bench

包含1403个PDF文件和7010个测试用例,评估OCR系统转换PDF为markdown的能力。

0 行 · 439 MB

  • 多模态
  • odc-by · 可商用

下载 5.9k · 收藏 243 · 5个月前更新

AletheiaResearch / GLM-5.2-Agent

GLM-5.2模型生成的284个代理追踪文件,包含训练可用的工具模式。

284 行 · 0 B

  • 多模态
  • 文本生成

下载 599 · 收藏 12 · 27天前更新

  • py from datasets import load_dataset ds = load_dataset("AletheiaResearch/GLM-5.2-Agent")