NVIDIA-NeMo/Gym

Evaluate and improve models and agents using environments

解決的問題

NeMo Gym 旨在評估與改進 AI 模型及智能體,特別是那些在程式碼執行、工具呼叫與沙箱等有狀態環境中運行的模型。它提供了一個可擴展的基礎設施,可以在數千個並行請求中執行評估與訓練任務,透過使用共享環境與驗證器,確保團隊間的可重複性。

工作原理

該函式庫使用模組化系統,其中「環境 (environment)」由任務數據集、智能體駕馭程序(模型如何與世界互動)與驗證器(如何對任務完成情況評分)組成。它與各種推論提供商(如 vLLM、OpenAI 與 Together.ai)以及訓練框架(如 NeMo RL、Unsloth 與 VeRL)整合,實現從評估到智能體優化與訓練的無縫轉換。

適用對象

面向需要進行大規模、可重複評估,或需要用於監督式微調 (SFT) 與強化學習 (RL) 訓練環境的 AI 智能體及 LLM 開發人員與研究人員。

亮點

  • 可擴展的評估:支援數千個並行環境,用於高吞吐量的評估與訓練。
  • 環境中心:涵蓋程式碼編寫、知識與科學等領域的流行基準測試與訓練環境集合。
  • 可插拔的沙箱:能夠透過各種沙箱提供商在隔離環境中執行使用工具的智能體。
  • 模組化架構:為智能體、任務與驗證器提供可擴展的介面,允許使用者使用自己的智能體或使用內建的駕驭程序。
  • 整合的生態系統:作為 NVIDIA NeMo 平台的一部分,與 GPU 加速訓練與優化工具整合。