OpenEnv: 在真實環境中評估使用工具的代理程式
Hugging Face 與 Meta 推出了 OpenEnv,這是一個旨在標準化評估與真實世界系統互動的 AI 代理程式(agents)之開源框架。透過將評估從受控模擬轉向真實工具與 API,OpenEnv 旨在彌合研究成功與生產可靠性之間持續存在的差距。
OpenEnv 框架概述
OpenEnv 提供了一種標準化的方法,將 AI 代理程式連接到真實的工作流程與工具,同時保持一致的評估結構。它利用了以 gym 為導向的 API——包含 reset、step、action 與 observations——類似於 OpenAI 的 Gymnasium。
為了確保不同領域與環境之間的一致性,OpenEnv 採用了標準的 Model Context Protocol (MCP) 工具呼叫介面。該框架的主要特性包括:
- 真實系統互動:針對實際系統而非模擬環境來評估代理程式。
- 狀態維護:環境會在多個動作之間維護狀態,這使得評估長程推理(long-horizon reasoning)成為可能。
- 直接 API 連接性:代理程式可以直接連接到真實世界的工具,例如程式碼儲存庫、瀏覽器與日曆。
Calendar Gym 基準測試
為了展示 OpenEnv 的實用性,Turing 貢獻了 Calendar Gym,這是一個專為日曆管理設計的生產級環境。日曆系統被用作基準測試,是因為它們要求代理程式處理複雜的真實世界約束,包括:
- 存取控制列表 (ACLs):管理不同使用者與日曆之間的權限。
- 部分可觀測性 (Partial Observability):處理對其他使用者狀態的有限可見度。
- 多步驟工作流程:以正確的順序串聯多個相依的操作。
- 時間推理:對時間進行推理並處理日期/時間格式。
在 Calendar Gym 中,代理程式會與各種操作進行互動,例如列出日曆與插入事件,同時在隔離的環境中運行,以確保不同執行次數之間可靠的比較。
代理程式可靠性的關鍵發現
在 Calendar Gym 中的代理程式評估顯示,隨著任務變得更加模糊且持續時間變長,可靠性會隨之下降。識別出的主要瓶頸包括:
多步驟推理
代理程式難以在較長的工作流程中正確地串聯動作,這表明基準測試必須超越單一工具呼叫的測試,轉而測試在多個相依步驟上的持續推理能力。
歧義解析
自然語言描述會顯著阻礙效能。在具有明確日曆識別碼的任務中,代理程式達到了近乎 90% 的成功率,但當任務以自然語言表述時,成功率下降到大約 40%。
執行品質
僅選擇正確的工具是不夠的。在失敗的互動中,超過一半的錯誤是由於工具參數格式錯誤或順序錯誤造成的,即使在選擇了正確的工具時也是如此。
常見的工具使用失敗模式
對生產環境工具整合的分析揭示了代理程式在與真實 API 互動時會遇到的三種常見失敗模式:
1. Schema 驗證錯誤
這些錯誤發生在代理程式呼叫了有效的工具,但提供的參數與 JSON schema 不符,例如缺少必要欄位(例如 calendarId)或資料類型錯誤(例如在需要物件的地方傳入字串)。
2. 權限與授權錯誤
這些是語法正確的呼叫,但因為權限不足而被 API 拒絕,例如過期的存取權杖(access tokens)或缺失的 OAuth scopes。研究人員建議提供結構化且具備可操作性的補救步驟,以幫助代理程式引導使用者,而不是重複嘗試相同的失敗呼叫。
3. 日期時間與格式錯誤
失敗通常發生在非 RFC3339 日期時間格式或缺少時區偏移量的情況下。建議的緩解措施是統一使用帶有明確時區偏移量的 RFC3339,並在文件中提供正確的範例以錨定模型行為。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- 專案
- Dispatch