Qwen / AgentWorldBench
评估语言世界模型的基准,数据来自真实环境轨迹与地面真值。
下载 87 · 收藏 17 · 27天前更新
- py from datasets import load_dataset ds = load_dataset("Qwen/AgentWorldBench")
评估语言世界模型的基准,数据来自真实环境轨迹与地面真值。
下载 87 · 收藏 17 · 27天前更新
包含1403个PDF文件和7010个测试用例,评估OCR系统转换PDF为markdown的能力。
下载 5.9k · 收藏 243 · 5个月前更新
GLM-5.2模型生成的284个代理追踪文件,包含训练可用的工具模式。
下载 599 · 收藏 12 · 27天前更新
FABLE.5和Mythos的完整追踪数据集,已去重并保留来源信息。
下载 674 · 收藏 12 · 1个月前更新
PyTorch问题与Triton内核实现配对的GPU延迟数据集,标签为内核运行时。
下载 84 · 收藏 11 · 1个月前更新
输入关键词,跨模型 / 数据集 / 空间 / 工具 / 资讯 / 论文 检索