rllm-org/rllm

Democratizing Reinforcement Learning for LLMs

解決的問題

rLLM 簡化了使用強化學習 (RL) 訓練語言智能體的過程。它消除了為不同環境或訓練後端重寫智能體程式碼的摩擦,允許在各種基準測試和沙箱中將相同的智能體邏輯用於評估和訓練。

工作原理

rLLM 使用一個流水線來執行智能體、收集軌跡、計算獎勵並更新模型。它採用一個模型閘道,透過 URL 路由工作階段透明地從 LLM 呼叫中擷取 token IDs 和 logprobs。這使得框架可以在無需更改智能體原始程式碼的情況下,將智能體互動結構化為 Episodes、Trajectories 和 Steps。該框架支援多種訓練後端(例如 verl、tinker 和 fireworks),並可以在各種沙箱(例如 Docker、Daytona 或 Modal)中執行智能體,並利用快照和熱池加速來降低成本。

適用對象

需要使用 GRPO、REINFORCE 和 RLOO 等 RL 方法來訓練和評估智能體程式的 AI 研究人員和產業團隊。

亮點

  • 後端無關性: 透過單一旗標即可在分散式多 GPU 訓練 (verl)、單機訓練 (tinker) 和 Fireworks 平台之間切換。
  • 廣泛的基準測試整合: 包括涵蓋數學、程式碼、問答和智能體任務(例如 SWE-bench、AIME)的 60 多個整合基準測試。
  • 靈活的 Harness: 支援 10 多個 CLI harness,並允許使用者使用簡單的裝飾器來封裝自己的智能體(例如 LangGraph 或 OpenAI Agents SDK)。
  • 沙箱支援: 與多種沙箱環境相容,以確保安全且具擴展性的展開。
  • 經過驗證的結果: 已用於建立 DeepScaleR、DeepCoder 和 DeepSWE 等最先進的開源模型。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案