ServiceNow/AgentLab
AgentLab: An open-source framework for developing, testing, and benchmarking web agents on diverse tasks, designed for scalability and reproducibility.
解決的問題
AgentLab 提供一個標準化的框架,用於開發與評估基於網頁的 AI 代理。它簡化了在多個基準測試上執行大規模實驗的過程,管理瀏覽器互動的複雜性,並分析代理在動態網頁環境中的表現。
工作原理
AgentLab 與 BrowserGym 整合,提供一組用於代理建立的模組。它使用統一的 LLM API 連接到各種提供者(OpenRouter、OpenAI、Azure 或自架設的 TGI),並利用 Ray 實現代理任務的大規模平行執行。該框架包含一個 Study 系統來管理實驗,一個 SequentialStudies 物件來處理特定基準測試中的任務依賴關係,以及一個名為 AgentXray 的專用視覺化工具,用於檢視代理的執行軌跡。
適用對象
專為需要執行廣泛基準測試、進行消融研究並確保結果可重現的研究人員與開發者設計。
主要亮點
- 廣泛的基準支援:相容多種基準測試,包括 WebArena、WorkArena、VisualWebArena、AssistantBench 和 OSWorld。
- 大規模平行處理:使用 Ray 在單一機器上平行執行數十個任務,並內建超時處理機制,防止任務卡住。
- 統一的 LLM 接口:透過單一 API 輕鬆切換不同 LLM 後端。
- AgentXray 可視化:基於 Gradio 的介面,用於視覺化代理軌跡、操作與截圖,便於除錯與分析效能。
- 可重現性工具:包含可重現性日誌與專用的 ReproducibilityAgent,可用於比較不同執行之間的執行差異。
相關
- 專案
- 專案
- 專案
- 專案
- 專案