PrimeIntellect-ai/prime-rl

Agentic RL Training at Scale

解決的問題

prime-rl 提供一個可擴展的大規模強化學習(RL)框架,能跨數千個 GPU 訓練超大型模型(最高達 1T+ 參數)。它解決了協調高吞吐量智能體訓練、多模態支援,以及在多節點叢集上部署前沿模型的複雜性。

工作原理

該框架採用完全非同步的強化學習架構,以最大化吞吐量。它利用 PyTorch FSDP2 進行訓練,vLLM 進行推論,並結合 FP8 推論、P/D 解耦、專家並行(EP)與上下文並行(CP)等進階優化技術,適用於混合專家(MoE)模型與長序列。它原生整合 Prime Intellect Environments Hub,支援智能體與 SWE(軟體工程)環境,並可透過 Slurm 與 Kubernetes 部署。

適用對象

專為訓練前沿規模模型的 AI 研究人員與工程師設計,特別是那些使用大型 MoE 模型、多模態 VLM 或需要大量運算資源的複雜智能體任務的研究者。

主要亮點

  • 超大規模擴展性:可擴展至 1000+ GPU,用於訓練 1T+ 參數的模型。
  • 高性能技術堆疊:結合 FSDP2 與 vLLM,支援 FP8 推論及 quack-kernels 等專用內核。
  • 端對端流程:支援完整的後訓練生命週期,包括 SFT、RL 訓練與評估。
  • 廣泛模型支援:針對多種 MoE 系列(如 GLM-5、Qwen3、Nemotron)優化,並支援多模態 VLM 如 Qwen3-VL。
  • 彈性部署方式:支援一行 SLURM 部署與原生 Kubernetes 集成。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案