opendilab/LightRFT

LightRFT: Light, Efficient, Omni-modal & Reward-model Driven Reinforcement Fine-Tuning Framework

何を解決するか

LightRFT は、人間からの強化学習(RLHF)および検証可能な報酬からの強化学習(RLVR)のための高性能フレームワークを提供します。大規模言語モデル(LLM)および視覚言語モデル(VLM)の微調整における複雑さとリソース集約性を軽減するために、効率的な推論エンジン、多様な最適化アルゴリズム、高度なメモリ管理を提供し、GPUのオーバーヘッドを削減します。

動作方法

LightRFT は、vLLM や SGLang などの高速推論バックエンドを統合し、サンプリングと生成を処理します。さまざまなポリシー最適化アルゴリズム(GRPO や GSPO など)とアドバンテージ推定技術を採用して、モデルの行動を最適化します。ハードウェア効率を最大化するために、「Colocate Anything」アプローチを採用し、報酬モデルとトレーニングモデルが同じGPUデバイスを共有できるようにし、FSDP v2 や DeepSpeed ZeRO などの分散トレーニング戦略もサポートしています。

対象ユーザー

マルチモーダルモデルのアライメントおよび強化学習に取り組むAI研究者や開発者向けに設計されており、特にテキスト、視覚言語、音声言語タスク向けの複雑な RLHF/RLVR パイプラインの実装を検討している方々に適しています。

特徴

  • マルチモーダル対応:LLM、VLM(例:Qwen-VL)、音声言語モデルのネイティブトレーニングパイプラインをサポート。
  • 多様なアルゴリズムセット:GRPO、GSPO、DAPO、REINFORCE++ などの最先端手法を実装。
  • リソース最適化:FP8 推論、エンジンのスリープ/ウェイク機構、報酬モデルのコロケーションにより通信オーバーヘッドを最小限に抑える。
  • スケーラブルなインフラ:FSDP v2、DeepSpeed ZeRO(ステージ1〜3)、混合精度トレーニング(BF16/FP16)を内蔵サポート。
  • 統合ツールキット:Weights & Biases との統合と、数学能力のベンチマークツール(GSM8K、Geo3K)を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト