ServiceNow/AgentLab

AgentLab: An open-source framework for developing, testing, and benchmarking web agents on diverse tasks, designed for scalability and reproducibility.

해결하는 문제

AgentLab은 웹 기반 AI 에이전트 개발 및 평가를 위한 표준화된 프레임워크를 제공합니다. 여러 벤치마크에 걸쳐 대규모 실험을 실행하는 과정을 단순화하고, 브라우저 상호작용의 복잡성을 관리하며, 동적 웹 환경에서 에이전트 성능 분석을 가능하게 합니다.

작동 방식

AgentLab은 BrowserGym과 통합되어 에이전트 생성을 위한 빌딩 블록 세트를 제공합니다. 다양한 제공자(OpenRouter, OpenAI, Azure, 또는 자체 호스팅된 TGI)에 연결하기 위한 통합된 LLM API를 사용하며, Ray를 활용하여 에이전트 작업의 대규모 병렬 실행을 수행합니다. 프레임워크에는 실험을 관리하는 Study 시스템, 특정 벤치마크에서 작업 의존성을 처리하는 SequentialStudies 객체, 그리고 에이전트 트레이스를 검사하기 위한 전용 시각화 도구인 AgentXray가 포함되어 있습니다.

대상 사용자

웹 에이전트 연구에 종사하는 연구자 및 개발자에게 적합하며, 광범위한 벤치마크 실행, 아블레이션 스터디, 결과의 재현성을 보장해야 하는 경우에 최적입니다.

주요 기능

  • 광범위한 벤치마크 지원: WebArena, WorkArena, VisualWebArena, AssistantBench, OSWorld 등 다양한 벤치마크와 호환됩니다.
  • 대규모 병렬 처리: Ray를 사용하여 단일 머신에서 수십 개의 작업을 병렬로 실행할 수 있으며, 멈춤을 방지하기 위한 내장 타임아웃 처리 기능이 있습니다.
  • 통합된 LLM 인터페이스: 다양한 LLM 백엔드 간을 쉽게 전환할 수 있는 단일 API 제공.
  • AgentXray 시각화: 에이전트 트레이스, 액션, 스크린샷을 시각화할 수 있는 Gradio 기반 인터페이스로 성능 디버깅 및 분석이 가능합니다.
  • 재현성 도구: 재현성 저널과 전용 ReproducibilityAgent를 포함하여, 다양한 실행 간의 실행 차이를 비교할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트