opendilab/LightRFT

LightRFT: Light, Efficient, Omni-modal & Reward-model Driven Reinforcement Fine-Tuning Framework

解決的問題

LightRFT 提供一個高效率的強化學習框架,支援人類反饋(RLHF)與可驗證獎勵(RLVR)。它透過高效的推論引擎、多樣的優化演算法與先進的記憶體管理,解決大型語言模型(LLMs)與視覺語言模型(VLMs)微調的複雜性與資源密集問題,有效降低 GPU 開銷。

如何運作

LightRFT 整合 vLLM 與 SGLang 等高速推論後端,處理取樣與生成。採用多種策略優化演算法(如 GRPO 與 GSPO)與優勢估計技術,以優化模型行為。為最大化硬體效率,採用「Colocate Anything」方法,允許獎勵模型與訓練模型共用同一 GPU 裝置,並支援 FSDP v2 與 DeepSpeed ZeRO 等分散式訓練策略。

適用對象

專為從事多模態模型對齊與強化學習的 AI 研究人員與開發者設計,特別適合希望為文字、視覺語言與語音語言任務實作複雜 RLHF/RLVR 流程的使用者。

主要特色

  • 全模態支援:原生支援 LLM、VLM(例如 Qwen-VL)與語音-語言模型的訓練流程。
  • 多樣演算法套件:實作先進方法,包含 GRPO、GSPO、DAPO 與 REINFORCE++。
  • 資源優化:支援 FP8 推論、引擎休眠/喚醒機制,以及獎勵模型共置,以最小化通訊開銷。
  • 可擴展基礎設施:內建支援 FSDP v2、DeepSpeed ZeRO(階段 1-3)與混合精度訓練(BF16/FP16)。
  • 整合工具鏈:支援 Weights & Biases 整合與數學能力基準測試工具(GSM8K、Geo3K)。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案