NVIDIA-NeMo/Gym

Evaluate and improve models and agents using environments

解決的問題

NeMo Gym 是一個專為評估與改進 AI 模型與代理所設計的程式庫,特別適用於在狀態化環境中運作的模型。它解決了在團隊間進行可重現、可擴展的評估與訓練執行的挑戰,尤其是在程式碼執行、工具呼叫與沙箱環境等複雜任務中,單純的無狀態模型輸出檢查已不足以應對需求。

工作原理

此程式庫提供一個模組化基礎設施,包含四個關鍵元件:資料集(待解決的任務)、代理 harness(模型與世界互動的方式)、驗證器(評分任務完成情況)以及狀態(每個任務的執行上下文)。它使用本地伺服器協調模型、代理與任務驗證流程之間的互動。可擴展至數千個並行環境,並與多種訓練框架(如 NeMo RL、Unsloth 和 VeRL)整合,支援 SFT 與 RL 訓練。

適用對象

適用於需要在複雜、狀態化環境中進行大規模、可重現的評估,以及評估驅動型訓練(RLHF/RL)的 AI 代理與 LLM 開發者與研究人員。

主要亮點

  • 可擴展的評估:支援數千個並行環境與每個任務的多次重複。
  • 模組化架構:為代理、任務與驗證器提供可擴展的介面。
  • 環境中心:包含多個領域(如程式碼、推理、指令遵循)的流行基準與訓練環境集合。
  • 訓練整合:可無縫從評估過渡到代理優化與 RL 訓練。
  • 可觀測性:支援在代理、模型與資源伺服器之間的可選 OpenTelemetry 追蹤。
  • 可插入式沙箱:支援多種沙箱提供者,包括 Docker、Daytona、ECS Fargate 等。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案