NVIDIA-NeMo/ProRL-Agent-Server
Agentic RL on Any Harness at Scale
解決的問題
Polar 是一個為真實世界代理工具鏈設計的強化學習(RL)回放框架。它透過提供「回放即服務」(Rollout-as-a-Service)架構,解決多輪 LLM 代理非同步強化學習訓練的可擴展性問題,讓開發者無需修改現有代理工具鏈即可產生軌跡(回放)。
工作原理
Polar 作為一個分散式伺服器系統運作。中央回放伺服器負責管理和分發請求至分散式網關節點。這些節點異步準備執行環境,執行代理,建構軌跡並進行評估。系統在代理執行程序與推論伺服器(如 vLLM 或 SGLang)之間設置代理,以處理通訊,使系統與訓練框架無關,並相容多種訓練框架。
適用對象
使用 RL 訓練 LLM 代理的研究人員與開發者,需要一種可擴展的方式,在不同環境與工具鏈之間產生與評估軌跡,而無需更改代理的核心程式碼。
核心亮點
- 工具鏈無關:無需程式碼修改,即可將現有代理工具鏈整合為 RL 就緒環境。
- 可擴展架構:透過平行回放預處理與執行時池化,優化 GPU 使用效率。
- 訓練框架無關:透過 HTTP 伺服器邊界,相容任意訓練框架。
- 可觀測性:提供專用儀表板用於監控與健康檢查。
- 廣泛支援:相容 vLLM 與 SGLang 推論伺服器。
相關
- 專案
- 專案
- 專案
- 專案
- 專案