hkust-nlp/Toolathlon
[ICLR 2026] The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
解決的問題
Toolathlon 是一個旨在評估語言代理在真實軟體環境中,使用多種工具完成複雜且長期任務能力的基準測試。它解決了對標準化方法的需求,用於測試代理在不同現實世界應用之間執行多步驟工作流程的能力。
如何運作
此專案提供一個包含 600 多種不同工具的全面測試套件。透過 Docker 或 Podman 進行容器化,為每個任務建立隔離環境,確保代理執行互不干擾。使用者可透過公開服務、本地部署或解耦模式執行評估——在解耦模式中,代理迴圈在主機上執行,而環境則保留在容器中。專案還包含一個視覺化工具,用於重播和分析 LLM 的推理軌跡。
適用對象
該工具主要面向需要在真實情境中嚴格評估模型工具使用能力與長期規劃能力的 AI 研究人員與語言代理開發者。
主要亮點
- 豐富的工具集:包含基於真實軟體的 600 多個工具。
- 長期任務導向:專注於需要多次順序呼叫工具才能完成的任務。
- 隔離執行:使用容器化環境確保任務隔離與並行評估。
- 靈活整合:支援多種代理架構,包括預設實作與 Claude Agent SDK,並初步整合 OpenHands。
- 推理軌跡視覺化:提供內建伺服器,用於重播與視覺化 LLM 的推理路徑。
相關
- 專案
- 專案
- 專案
- 專案
- 專案