PrimeIntellect-ai/prime-rl

Agentic RL Training at Scale

何を解決するか

prime-rl は大規模強化学習(RL)のスケーラブルなフレームワークを提供し、数千のGPUを跨いで巨大なモデル(最大1T+パラメータ)の学習を可能にします。高スループットのエージェント学習、マルチモーダル対応、およびマルチノードクラスタ上での最先端モデルのデプロイの複雑さに対処します。

仕組み

このフレームワークは、スループットを最大化する完全非同期RLアーキテクチャを採用しています。学習にはPyTorch FSDP2、推論にはvLLMを使用し、FP8推論、P/D非統合、Mixture-of-Experts(MoE)モデルおよび長文シーケンス向けのエキスパート並列(EP)とコンテキスト並列(CP)といった高度な最適化技術を組み込みます。Prime Intellect Environments Hub とネイティブに統合され、エージェントおよびSWE(ソフトウェアエンジニアリング)環境をサポートし、SlurmおよびKubernetesを介したデプロイを可能にしています。

対象ユーザー

最先端スケールのモデルを学習するAI研究者およびエンジニア向けです。特に大規模MoEモデル、マルチモーダルVLM、または膨大な計算リソースを必要とする複雑なエージェントタスクに取り組んでいる方々に適しています。

主な特徴

  • 大規模スケーラビリティ: 1000台以上のGPUで1T+パラメータのモデル学習にスケーリング可能。
  • 高性能スタック: FSDP2とvLLMをFP8推論およびquack-kernelsなどの専用カーネルと組み合わせ。
  • エンドツーエンドパイプライン: SFT、RL学習、評価を含む、ポストトレーニングライフサイクルの全工程をサポート。
  • 広範なモデル対応: GLM-5、Qwen3、NemotronなどさまざまなMoEファミリーを最適化し、Qwen3-VLなどのマルチモーダルVLMもサポート。
  • 柔軟なデプロイ: 1行のSLURMデプロイとネイティブKubernetesサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト