Hugging Face 與 Meta 推出 OpenEnv 以支援代理環境

Hugging Face 與 Meta 已合作推出 OpenEnv 與 OpenEnv Hub,這是一個共享的社群空間,用於建立、分享與探索標準化的代理環境。此計畫旨在提供安全、沙盒化的基礎,讓 AI 代理的開發、訓練與部署得以將模型與執行任務所需的工具與執行環境解耦。

使用 OpenEnv 標準化代理環境

OpenEnv 提供了一個定義代理環境的框架——安全、語意清晰的沙盒,將代理完成任務所需的一切(包括工具、API、憑證與執行環境)封裝其中。透過使用這些環境,開發者可以避免將數百萬工具直接暴露給大型語言模型所帶來的安全與複雜性風險。

OpenEnv 環境的主要特徵包括:

  • 語意清晰:對任務需求的明確定義。
  • 沙盒執行:內建安全保證與隔離執行。
  • 驗證存取:與已驗證的工具與 API 無縫整合。

OpenEnv Hub 與開發者工作流程

Hugging Face 上的 OpenEnv Hub 讓開發者能建立與分享相容於 OpenEnv 的環境。任何符合規範上傳至 Hub 的環境皆會自動取得整合功能,使開發者能:

  • 以「人類代理」的方式與環境互動以進行測試。
  • 部署模型以在環境中解決任務。
  • 檢視已暴露的工具與觀測定義。
  • 在啟動完整強化學習(RL)訓練前,驗證並迭代環境。

技術規格與 RFC

Meta-PyTorch 已發布 OpenEnv 0.1 規格(RFC),以建立社群標準。目前的實作允許環境創建者使用 step(), reset()close() API。三項主要的 Request for Comments(RFC)正於審核中,以塑造架構:

  • RFC 001:確立核心元件的架構,包括 Environment、Agent 與 Task 之間的關係。
  • RFC 002:提出基本的環境介面、封裝、隔離與通訊協定。
  • RFC 003:提出透過環境抽象與隔離邊界封裝模型上下文協定(MCP)工具。

OpenEnv 的核心使用案例

OpenEnv 設計用以支援代理開發的完整生命週期,從訓練到推論:

  • RL 後訓練:與 TRL、TorchForge+Monarch 與 VeRL 等函式庫整合,以在各種環境集合中訓練 RL 代理。
  • 環境建立:確保自訂環境與流行 RL 工具之間的互通性。
  • SOTA 方法再現:透過提供代理式程式編寫與軟體工程的環境,使得如 FAIR 的 Code World Model 等最先進方法得以重現。
  • 部署:提供統一的流程,使用者可在同一環境中建立、訓練並執行推論。

生態系統整合與路線圖

OpenEnv 正整合至 Meta 的 TorchForge RL 函式庫,並與其他開源 RL 專案如 verl、TRL 與 SkyRL 合作。支援平台包括 Unsloth 與 Lightning.AI。此專案可於 PyPI 取得,套件名稱為 openenv-core,並附有完整的教學 notebook,示範端到端實作。

Sources