xlang-ai/OSWorld-V2

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks

解決的問題

OSWorld-V2 提供了一個標準化的基準與環境,用於評估具備「電腦使用」能力的 AI 代理。它解決了在需要與完整作業系統(包括瀏覽器、應用程式與檔案系統)互動的長期、現實世界任務上測試代理的困難,同時透過限制任務定義與資源存取來防止基準洩漏。

工作原理

該專案透過 Docker 或 AWS 建立一個受控的虛擬機(VM)環境,讓代理能夠執行操作。它使用一組託管於 Hugging Face 上的受保護 Python 任務類別與資源來定義目標並評估成功。為確保真實性與穩定性,系統採用模擬網站與自架設的 GitLab 實例來處理特定任務。該系統支援多環境並行執行,並提供工具用於手動檢查任務與記錄軌跡。

適用對象

專為 AI 研究人員與開發者設計,他們正在建構能透過螢幕截圖感知螢幕內容,並與電腦介面互動以完成複雜多步驟工作流程的多模態代理。

主要亮點

  • 真實世界模擬:在實際作業系統環境中測試代理,而非簡化 API。
  • 防止洩漏:任務類別與資源透過受保護的 Hugging Face 資料集分發,防止代理在訓練資料中找到答案。
  • 彈性基礎設施:支援本地 Docker 部署與可擴展的 AWS 並行評估。
  • 完整的工具集:包含軌跡檢視器、手動檢查腳本,以及從 OSWorld 1.0 迁移代理的遷移工具。

相關

  • 專案
  • 專案
  • 專案
  • 專案