hkust-nlp/Toolathlon

[ICLR 2026] The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

解決する課題

Toolathlonは、現実的なソフトウェア環境で複雑で長期的なタスクを完了するために、多様なツールを活用する言語エージェントの能力を評価するためのベンチマークです。これは、さまざまな現実世界のアプリケーションにまたがる複数ステップのワークフローを実行する能力を標準化された方法でテストする必要性に対応しています。

動作方法

このプロジェクトは、600以上の多様なツールを備えた包括的なテストスイートを提供します。各タスクに対してDockerまたはPodmanによるコンテナ化を使用して、隔離された環境を構築し、エージェントの実行が互いに干渉しないようにします。ユーザーは公開サービス、ローカル設定、またはエージェントループをホスト上で実行しながら環境をコンテナ内に維持する非同期モードで評価を実行できます。また、LLMの推論経路を再再生・分析するための可視化ツールも含まれています。

対象ユーザー

このツールは、現実的なシナリオにおけるモデルのツール利用能力や長期計画能力を厳密にベンチマークする必要があるAI研究者および言語エージェント開発者を主な対象としています。

特徴

  • 広範なツールセット: 実世界のソフトウェアに基づく600以上のツールを含みます。
  • 長期タスク中心: 複数の順次ツール呼び出しを必要とするタスクに焦点を当てています。
  • 隔離実行: コンテナ化された環境を使用してタスクの隔離と並列評価を確保します。
  • 柔軟な統合: デフォルト実装やClaude Agent SDKを含む複数のエージェントスケルトンをサポートし、OpenHandsへの初期統合も提供しています。
  • 推論経路の可視化: LLMの推論経路を再再生・可視化するための組み込みサーバーを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト