OpenRLHF/OpenRLHF
An Easy-to-use, Scalable and High-performance Agentic RL Framework based on Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)
解決的問題
OpenRLHF 是一個高性能、生產級的框架,旨在使人類回饋強化學習 (RLHF) 具備可擴展性與擴充性。透過將高吞吐量推理引擎與分散式訓練架構相結合,它解決了樣本生成的瓶頸——這通常消耗了 RLHF 訓練時間的 80%。
工作原理
該框架利用分散式架構,結合了用於調度與模型分離(Actor、Reward、Reference 與 Critic 模型)的 Ray、用於高性能樣本生成的 vLLM 以及用於記憶體高效訓練的 DeepSpeed ZeRO-3。
其核心創新在於統一的基於代理的設計範式。它將每次訓練執行視為「token-in-token-out」代理執行,允許同一流水線同時支援單輪 RLHF(標準單次生成)與多輪 RLHF(與環境回饋的複雜互動)。這種設計將 RL 演算法與執行模式解耦,這意味著任何支援的演算法都可以與任何代理模式配合使用。
適用對象
它專為需要使用 RLHF 訓練大規模語言模型(高達 70B+ 參數)的研究人員與工程師而建,特別是那些從事推理模型、視覺語言模型 (VLM) 或互動式代理工作的人員。
亮點
- 多樣化的 RL 演算法:支援 PPO、REINFORCE++、GRPO 與 RLOO。
- 基於代理的執行:統一的單輪與多輪互動流水線,包括對外部環境回饋的支援。
- VLM 支援:具備使用圖像輸入與多輪圖像回饋訓練視覺語言模型的能力。
- 混合引擎調度:透過允許模型與 vLLM 引擎共享資源,實現 GPU 利用率最大化。
- 可擴展性:集成了用於長上下文訓練的 DeepSpeed AutoTP 與 RingAttention,以及透過 SLURM 實現的多節點擴展。
相關
- 專案
- 專案
- 專案
- 專案
- 專案