rdi-berkeley/agents-last-exam
Agents' Last Exam
解決的問題
AI代理的最終考試(ALE)解決了缺乏廣泛覆蓋的AI代理評估基準的問題,這些基準能夠衡量代理在長期、具有經濟價值的真實專業任務上的表現。它超越了簡單的提示,評估代理是否能夠實際完成跨多個產業領域的複雜工作,並獲得可驗證的結果。
如何運作
ALE 提供一個開放的評估框架,將待測系統(代理工具)與一個真實的環境(Windows 或 Linux沙箱)以及特定的專業任務配對。
關鍵組件包括:
- CUA-agents:該框架評估同時具備命令列介面(CLI)和圖形使用者介面(GUI)能力的代理。它使用跨作業系統 CUA MCP 橋接器,將點擊和輸入等桌面操作作為工具暴露給代理。
- 沙箱:任務在真實機器(虛擬機或容器)上執行,複現生產環境,包括專業軟體和資料。
- 決定性評分:每個任務都有一個隱藏的參考,由評分器在代理完成工作後,根據其輸出在 0 到 1 的範圍內進行評分。
- 執行循環:系統會配置沙箱,準備輸入,執行代理直至完成,準備隱藏參考,然後對結果進行評分。
適用對象
ALE 專為前沿代理系統開發者和需要評估其代理在真實作業系統環境中執行多步驟專業工作流程能力的研究人員設計。
亮點
- 廣泛覆蓋:基於美國聯邦職業分類,涵蓋 13 個產業群組中的 55 個子領域。
- 可驗證結果:使用隱藏參考和決定性評分器防止資訊洩漏,確保客觀評分。
- 多平台支援:支援透過 Google Cloud、AWS、Alibaba Cloud、QEMU/KVM 和 Docker 部署沙箱。
- 完整審計:記錄每次執行的統一軌跡、原始日誌和產物,支援端對端回放。
相關
- 專案
- 專案
- 專案
- 專案
- 專案