StonyBrookNLP/appworld
🌍 AppWorld: A Controllable World of Apps and People for Benchmarking Function Calling and Interactive Coding Agent, ACL'24 Best Resource Paper.
해결하는 문제
AppWorld는 API와 코드를 통해 소프트웨어와 상호작용해야 하는 AI 에이전트를 위한 현실적이고 실행 가능한 테스트베드를 제공합니다. 연구자와 개발자는 실제 서비스를 사용하는 비용이나 위험 없이, 통제된 그러나 현실적인 환경에서 에이전트가 복잡하고 다단계 작업을 얼마나 잘 처리하는지 측정할 수 있습니다.
작동 방식
AppWorld는 약 100명의 사람들이 Spotify나 Venmo와 같은 9개의 일상 앱을 457개의 HTTP API를 통해 사용하는 세계를 시뮬레이션합니다. 각 작업은 감독자, 지시사항, 초기 상태(데이터베이스와 시간)를 정의합니다. 에이전트는 ApiDocs나 Supervisor와 같은 보조 앱을 사용하여 이러한 API를 호출하는 코드를 자율적으로 작성하고 실행하여 지시사항을 완수해야 합니다. 엔진은 행동을 추적하고, 정답 설정과 비교하여 정확성을 평가하며, 리더보드 제출을 위해 출력을 기록합니다. 환경은 사전 격리된 상태로, FastAPI의 테스트 클라이언트를 사용해 서버리스로 실행하거나 Docker를 통해 격리된 환경에서 실행할 수 있습니다.
대상 사용자
함수 호출, 도구 사용, 인터랙티브 코딩에 초점을 맞춘 LLM 기반 에이전트를 개발하고 비교하는 연구자들. 또한 에이전트 프레임워크를 테스트하거나 모델이 현실적이고 다단계 디지털 작업을 얼마나 잘 처리하는지 연구하는 모든 사람에게 유용합니다.
주요 특징
- 고정밀 시뮬레이션: 9개의 현실적인 앱, 457개의 API, 관계를 가진 약 100명의 시뮬레이션된 사람.
- 풍부하고 상호작용적인 코딩 및 API 호출이 필요한 자연스럽고 다양한 작업들.
- 포괄적인 도구 세트: 설치, 데이터 다운로드, 탐색, 평가, 리더보드 제출을 위한 CLI.
- 암호화 및 카나리 문자를 포함하여 학습 코퍼스로의 누출 위험을 줄입니다.
- 여러 에이전트 프레임워크를 지원하며, MCP 서버/클라이언트 통합을 포함합니다.
- 활성 리더보드와 광범위한 문서, 가이드, 동영상이 제공됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트