hkust-nlp/Toolathlon
[ICLR 2026] The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
해결하는 문제
Toolathlon은 현실적인 소프트웨어 환경에서 복잡하고 장기적인 작업을 완료하기 위해 다양한 도구를 활용하는 언어 에이전트의 능력을 평가하기 위한 벤치마크입니다. 다양한 실제 애플리케이션을 통해 다단계 워크플로우를 실행하는 에이전트의 능력을 표준화된 방식으로 테스트할 필요성을 해결합니다.
작동 방식
이 프로젝트는 600개 이상의 다양한 도구를 포함하는 포괄적인 테스트 세트를 제공합니다. 각 작업에 대해 Docker 또는 Podman를 사용한 컨테이너화를 통해 격리된 환경을 생성하여 에이전트 실행이 서로 간섭하지 않도록 합니다. 사용자는 공개 서비스, 로컬 설정, 또는 에이전트 루프를 호스트에서 실행하면서 환경은 컨테이너 내에 유지되는 분리된 모드로 평가를 수행할 수 있습니다. 또한 LLM의 추론 경로를 재생하고 분석할 수 있는 시각화 도구도 포함되어 있습니다.
대상 사용자
이 도구는 현실적인 시나리오에서 모델의 도구 사용 능력과 장기 계획 능력을 엄격하게 벤치마크할 필요가 있는 AI 연구자 및 언어 에이전트 개발자를 주요 대상으로 합니다.
주요 특징
- 풍부한 도구 세트: 실제 소프트웨어 기반의 600개 이상의 도구를 포함합니다.
- 장기적 작업 중심: 여러 단계의 도구 호출이 필요한 작업에 집중합니다.
- 격리된 실행: 컨테이너 기반 환경을 사용하여 작업 격리와 병렬 평가를 보장합니다.
- 유연한 통합: 기본 구현과 Claude Agent SDK를 포함한 다양한 에이전트 스크래핑을 지원하며, OpenHands에 대한 초기 통합도 제공합니다.
- 추론 경로 시각화: LLM의 추론 경로를 재생하고 시각화할 수 있는 내장 서버를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트