PrimeIntellect-ai/prime-rl
Agentic RL Training at Scale
해결하는 문제
prime-rl은 대규모 강화학습(RL)을 위한 확장 가능한 프레임워크를 제공하여 수천 개의 GPU를 통해 거대한 모델(최대 1T+ 파라미터)을 학습할 수 있게 합니다. 고처리량 에이전트 학습, 다중 모달 지원, 그리고 다중 노드 클러스터에서 최전방 모델을 배포하는 복잡성을 해결합니다.
작동 방식
이 프레임워크는 최대한의 처리량을 위해 완전히 비동기적 RL 아키텍처를 사용합니다. 학습에는 PyTorch FSDP2, 추론에는 vLLM을 활용하며, FP8 추론, P/D 분리, Mixture-of-Experts(MoE) 모델 및 긴 시퀀스를 위한 전문가 병렬(EP)과 컨텍스트 병렬(CP)과 같은 고급 최적화 기술을 포함합니다. Prime Intellect Environments Hub와 네이티브로 통합되어 에이전트 및 SWE(소프트웨어 공학) 환경을 지원하며, Slurm 및 Kubernetes를 통해 배포가 가능합니다.
대상 사용자
최전방 규모의 모델을 학습하는 AI 연구자 및 엔지니어를 위한 것입니다. 특히 대규모 MoE 모델, 다중 모달 VLM, 또는 막대한 컴퓨팅 자원이 필요한 복잡한 에이전트 작업에 종사하는 분들에게 적합합니다.
주요 특징
- 거대한 확장성: 1000개 이상의 GPU에서 1T+ 파라미터 모델 학습에 확장 가능.
- 고성능 스택: FSDP2와 vLLM을 FP8 추론 및 quack-kernels와 같은 전용 커널과 결합.
- 엔드투엔드 파이프라인: SFT, RL 학습, 평가를 포함한 포스트트레이닝 라이프사이클 전반을 지원.
- 광범위한 모델 지원: GLM-5, Qwen3, Nemotron 등 다양한 MoE 패밀리 최적화 및 Qwen3-VL과 같은 다중 모달 VLM 지원.
- 유연한 배포: 1줄의 SLURM 배포 및 네이티브 Kubernetes 지원.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트