Qwen / AgentWorldBench
评估语言世界模型的基准,数据来自真实环境轨迹与地面真值。
下载 87 · 收藏 17 · 27天前更新
- py from datasets import load_dataset ds = load_dataset("Qwen/AgentWorldBench")
2026-06-25
评估语言世界模型的基准,数据来自真实环境轨迹与地面真值。
下载 87 · 收藏 17 · 27天前更新
包含1403个PDF文件和7010个测试用例,评估OCR系统转换PDF为markdown的能力。
下载 5.9k · 收藏 243 · 5个月前更新
GLM-5.2模型生成的284个代理追踪文件,包含训练可用的工具模式。
下载 599 · 收藏 12 · 27天前更新