OpenRLHF/OpenRLHF

An Easy-to-use, Scalable and High-performance Agentic RL Framework based on Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)

解決的問題

OpenRLHF 是一個高性能、生產級的框架,旨在使人類回饋強化學習 (RLHF) 具備可擴展性與擴充性。透過將高吞吐量推理引擎與分散式訓練架構相結合,它解決了樣本生成的瓶頸——這通常消耗了 RLHF 訓練時間的 80%。

工作原理

該框架利用分散式架構,結合了用於調度與模型分離(Actor、Reward、Reference 與 Critic 模型)的 Ray、用於高性能樣本生成的 vLLM 以及用於記憶體高效訓練的 DeepSpeed ZeRO-3

其核心創新在於統一的基於代理的設計範式。它將每次訓練執行視為「token-in-token-out」代理執行,允許同一流水線同時支援單輪 RLHF(標準單次生成)與多輪 RLHF(與環境回饋的複雜互動)。這種設計將 RL 演算法與執行模式解耦,這意味著任何支援的演算法都可以與任何代理模式配合使用。

適用對象

它專為需要使用 RLHF 訓練大規模語言模型(高達 70B+ 參數)的研究人員與工程師而建,特別是那些從事推理模型、視覺語言模型 (VLM) 或互動式代理工作的人員。

亮點

  • 多樣化的 RL 演算法:支援 PPO、REINFORCE++、GRPO 與 RLOO。
  • 基於代理的執行:統一的單輪與多輪互動流水線,包括對外部環境回饋的支援。
  • VLM 支援:具備使用圖像輸入與多輪圖像回饋訓練視覺語言模型的能力。
  • 混合引擎調度:透過允許模型與 vLLM 引擎共享資源,實現 GPU 利用率最大化。
  • 可擴展性:集成了用於長上下文訓練的 DeepSpeed AutoTP 與 RingAttention,以及透過 SLURM 實現的多節點擴展。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案