PrimeIntellect-ai/prime-rl

Agentic RL Training at Scale

解决的问题

prime-rl 提供了一个可扩展的大规模强化学习(RL)框架,能够跨数千个 GPU 训练超大规模模型(高达 1T+ 参数)。它解决了协调高吞吐量智能体训练、多模态支持以及在多节点集群上部署前沿模型的复杂性。

工作原理

该框架采用完全异步的强化学习架构以最大化吞吐量。它利用 PyTorch FSDP2 进行训练,vLLM 进行推理,并结合了 FP8 推理、P/D 解耦、专家并行(EP)和上下文并行(CP)等高级优化技术,适用于混合专家(MoE)模型和长序列。它原生集成 Prime Intellect Environments Hub,支持智能体和 SWE(软件工程)环境,并可通过 Slurm 和 Kubernetes 部署。

适用人群

专为训练前沿规模模型的 AI 研究人员和工程师设计,特别是那些使用大型 MoE 模型、多模态 VLM 或需要大量计算资源的复杂智能体任务的研究者。

主要亮点

  • 超大规模扩展性:可扩展至 1000+ GPU,用于训练 1T+ 参数的模型。
  • 高性能技术栈:结合 FSDP2 与 vLLM,支持 FP8 推理及 quack-kernels 等专用内核。
  • 端到端流水线:支持完整的后训练生命周期,包括 SFT、RL 训练和评估。
  • 广泛模型支持:针对多种 MoE 系列(如 GLM-5、Qwen3、Nemotron)优化,并支持多模态 VLM 如 Qwen3-VL。
  • 灵活部署方式:支持一行 SLURM 部署和原生 Kubernetes 集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目