ServiceNow/AgentLab

AgentLab: An open-source framework for developing, testing, and benchmarking web agents on diverse tasks, designed for scalability and reproducibility.

何を解決するか

AgentLab は、ウェブベースの AI エージェントの開発と評価のための標準化されたフレームワークを提供します。複数のベンチマークにわたる大規模な実験を実行するプロセスを簡素化し、ブラウザ操作の複雑さを管理し、動的なウェブ環境におけるエージェントのパフォーマンス分析を可能にします。

仕組み

AgentLab は BrowserGym と統合され、エージェント作成のためのビルディングブロックのセットを提供します。統一された LLM API を使用して、さまざまなプロバイダー(OpenRouter、OpenAI、Azure、または自前ホスティングの TGI)に接続し、Ray を活用してエージェントタスクの大規模並列実行を実現します。フレームワークには、実験を管理する Study システム、特定のベンチマークにおけるタスク依存関係を処理する SequentialStudies オブジェクト、およびエージェントトレースを検査するための専用可視化ツールである AgentXray が含まれます。

対象ユーザー

ウェブエージェント研究に取り組む研究者や開発者向けに設計されており、広範なベンチマーク実行、アブレーションスタディ、結果の再現性の確保が必要な方々に最適です。

特徴

  • 広範なベンチマーク対応: WebArena、WorkArena、VisualWebArena、AssistantBench、OSWorld など、多数のベンチマークと互換性があります。
  • 大規模並列処理: Ray を使用して、1台のマシン上で数十のジョブを並列実行可能。ハングアップを防ぐための組み込みタイムアウト処理も備えています。
  • 統一された LLM インターフェース: さまざまな LLM バックエンド間を簡単に切り替えるための単一の API。
  • AgentXray 可視化: エージェントトレース、アクション、スクリーンショットを可視化する Gradio ベースのインターフェースで、パフォーマンスのデバッグと分析が可能。
  • 再現性ツール: 再現性ジャーナルと専用の ReproducibilityAgent を含み、異なる実行間での実行差分を比較できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト