nvidia-cosmos/cosmos-rl
Cosmos-RL is a flexible and scalable Reinforcement Learning framework specialized for Physical AI applications.
何を解決するか
Cosmos-RL は、身体的なAIアプリケーションにおける大規模強化学習(RL)トレーニングの複雑さに対応するように設計されており、エメーブドエージェントのトレーニングに伴う重い計算負荷を管理するためのスケーラブルで柔軟なフレームワークを提供します。
動作方法
このフレームワークは、トレーニングプロセスを専門的な役割に分離する、分離型の単一コントローラーアーキテクチャを使用しています:
- ポリシー(コンシューマー): トレーニングインスタンス専用のレプリカ。
- ロールアウト(プロデューサー): ジェネレーションエンジン専用のレプリカ。
- コントローラー: ポリシーとロールアウトレプリカ間での重みとロールアウトを調整する効率的なメッセージングシステム。
パフォーマンスを最大化するために、複数の並列化戦略(Tensor、Sequence、Context、FSDP、Pipeline)をサポートし、低精度トレーニングおよびロールアウト(FP8およびFP4)を活用してメモリと計算のオーバーヘッドを削減します。
対象ユーザー
ロボット工学、自動運転車両、スマートスペースなどの物理的AIに取り組む開発者や研究者で、大規模RLトレーニングワークロードに到達したい方を対象としています。
主な特徴
- 高度な並列化: GPU間でワークロードを分散するための5種類の並列化をサポート。
- 非同期アーキテクチャ: ポリシーとロールアウトレプリカを分離することで、より高い効率性を実現。
- エラスティックトレーニング: 動的NCCLプロセスグループを使用して、GPUの登録・非登録をリアルタイムで可能にし、障害耐性を確保。
- 低精度サポート: FP8およびFP8/FP4精度に最適化されており、トレーニングとロールアウトの高速化を実現。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト