hkust-nlp/Toolathlon

[ICLR 2026] The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

解决的问题

Toolathlon 是一个旨在评估语言代理在真实软件环境中,使用多种工具完成复杂、长期任务能力的基准测试。它解决了对标准化方法的需求,用于测试代理在不同现实世界应用之间执行多步骤工作流的能力。

如何工作

该项目提供了一个包含 600 多种不同工具的全面测试套件。通过 Docker 或 Podman 进行容器化,为每个任务创建隔离环境,确保代理执行互不干扰。用户可以通过公共服务、本地部署或解耦模式运行评估——在解耦模式中,代理循环在主机上运行,而环境保持在容器中。项目还包含一个可视化工具,用于回放和分析 LLM 的推理轨迹。

适用对象

该工具主要面向需要在真实场景中严格评估模型工具使用能力和长期规划能力的 AI 研究人员和语言代理开发者。

主要亮点

  • 丰富的工具集:包含基于真实软件的 600 多个工具。
  • 长期任务导向:专注于需要多次顺序调用工具才能完成的任务。
  • 隔离执行:使用容器化环境确保任务隔离和并行评估。
  • 灵活集成:支持多种代理框架,包括默认实现和 Claude Agent SDK,并初步集成了 OpenHands。
  • 推理轨迹可视化:提供内置服务器,用于回放和可视化 LLM 的推理路径。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目