RLinf/RLinf

RLinf: Reinforcement Learning Infrastructure for Embodied and Agentic AI

何を解決するか

RLinfは、強化学習(RL)モデルのトレーニングに向けたスケーラブルで柔軟なインフラを提供し、特にエムボディドAI(ロボティクス)とエージェントAIを対象としています。分散プログラミングの複雑さを排除し、コードを変更せずに多数のGPUノードにトレーニングをスケーリング可能にし、高性能なRLトレーニングのスループットを最適化します。

動作方法

RLinfは、RLトレーニングの堅牢な基盤として機能し、PPO、GRPO、SACなどのさまざまなアルゴリズムをサポートし、FSDP、HuggingFace、SGLang、vLLMなどの複数のバックエンドと統合しています。エムボディドRLではハイブリッド実行モードを採用し、スループットを向上させ、NVIDIA GPU、Moore Threads(MUSA)、Huawei Ascend(CANN)、AMD(ROCm)など幅広いアクセラレータをサポートしています。

対象ユーザー

ビジョン・言語・アクション(VLA)モデル、ロボットポリシー学習、エージェントAIに取り組む研究者や開発者向けに設計されており、大規模な分散トレーニングおよび実世界のロボットデプロイメントに対応できるシステムが必要な方々に最適です。

主な特徴

  • 広範なハードウェア対応:NVIDIA、AMD、Huawei Ascend、Moore Threadsアクセラレータと互換性があります。
  • 広範なシミュレータ統合:Isaac Lab、LIBERO、RoboCasa、Metaworldなどに対応しています。
  • 実世界での実行能力:FrankaやXSquare Turtle2などの物理ロボット上でオンラインポリシー学習が可能なRLinf-USERを含みます。
  • システム最適化:動的コンピュートリアロケーションを実現するDynaRLと、MoE通信を高速化するFUSCOを搭載しています。
  • 多様なRLサポート:オフラインIQLやSFTからオンラインRL、大規模モデル向けのGRPOファインチューニングまで、あらゆる用途に対応しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト