meta-pytorch/torchforge

PyTorch-native post-training at scale

解決する課題

強化学習(RL)の研究から、インフラ管理の複雑さを排除します。モデルのロジックを基盤となるハードウェアや通信パターンから分離することで、研究者は分散システムやGPU配置の専門家である必要なく、RLアルゴリズムの開発に集中できます。

仕組み

Torchforgeは、明確なRL抽象化セットと、それらのスケーラブルな実装を提供します。ユーザーは数千個のGPUにわたって非同期トレーニングと同期トレーニングを切り替えることができ、同時に、障害処理、トレーニング負荷の再転送、通信パターンに対してきめ細かな制御を必要とするパワーユーザー向けに、低レベルのプリミティブも提供します。

対象ユーザー

数個のGPUから数千個のGPUまでスケール可能な、エージェント型RLのためのスケーラブルでPyTorchネイティブなライブラリを必要とするRL研究者およびパワーユーザー向けに設計されています。

ハイライト

  • インフラの抽象化: RLループを基盤となるインフラから分離し、研究を加速させます。
  • 高いスケーラビリティ: 非同期と同期のトレーニングを切り替えられる柔軟性を持ち、数千個のGPUにわたるスケーリングをサポートします。
  • ハックのしやすさ: インフラ層とやり取りすることなく、RLループのすべての部分を変更できます。
  • PyTorchネイティブ: ROCmのサポート、vLLMおよびtorchtitanとの統合を含む、PyTorchエコシステムとの深い統合を実現するように構築されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト