PrimeIntellect-ai/prime-rl
Agentic RL Training at Scale
何を解決するか
prime-rl は大規模強化学習(RL)のスケーラブルなフレームワークを提供し、数千のGPUを跨いで巨大なモデル(最大1T+パラメータ)の学習を可能にします。高スループットのエージェント学習、マルチモーダル対応、およびマルチノードクラスタ上での最先端モデルのデプロイの複雑さに対処します。
仕組み
このフレームワークは、スループットを最大化する完全非同期RLアーキテクチャを採用しています。学習にはPyTorch FSDP2、推論にはvLLMを使用し、FP8推論、P/D非統合、Mixture-of-Experts(MoE)モデルおよび長文シーケンス向けのエキスパート並列(EP)とコンテキスト並列(CP)といった高度な最適化技術を組み込みます。Prime Intellect Environments Hub とネイティブに統合され、エージェントおよびSWE(ソフトウェアエンジニアリング)環境をサポートし、SlurmおよびKubernetesを介したデプロイを可能にしています。
対象ユーザー
最先端スケールのモデルを学習するAI研究者およびエンジニア向けです。特に大規模MoEモデル、マルチモーダルVLM、または膨大な計算リソースを必要とする複雑なエージェントタスクに取り組んでいる方々に適しています。
主な特徴
- 大規模スケーラビリティ: 1000台以上のGPUで1T+パラメータのモデル学習にスケーリング可能。
- 高性能スタック: FSDP2とvLLMをFP8推論およびquack-kernelsなどの専用カーネルと組み合わせ。
- エンドツーエンドパイプライン: SFT、RL学習、評価を含む、ポストトレーニングライフサイクルの全工程をサポート。
- 広範なモデル対応: GLM-5、Qwen3、NemotronなどさまざまなMoEファミリーを最適化し、Qwen3-VLなどのマルチモーダルVLMもサポート。
- 柔軟なデプロイ: 1行のSLURMデプロイとネイティブKubernetesサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト