verl-project/verl
verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework
What it solves
verl은 대규모 언모델(LLM)을 위해 특별히 설계된 프로덕션 레디 RL(강화학습) 훈련 라이브러리입니다. 사후 훈련 정렬(post-training alignment)의 복잡성을 해결하여, 개발자가 최소한의 코드로 다양한 RL 알고리즘(PPO, GRPO 등)을 구현할 수 있게 하며, 대규모 GPU 클러스터에서 높은 처리량과 확장성을 유지합니다.
How it works
이 라이브러리는 계산과 데이터 의존성을 분리하는 하이브리드 컨트롤러 프로그래밍 모델(HybridFlow)을을 사용합니다. 이를 통해 다양한 LLM 인프라 구성 요소와 원활하게 통합됩니다:
- Training Backends: FSDP, FSDP2, 및 Megatron-LM을 지원합니다.
- Rollout Generation: vLLM, SGLang, 및 Hugging Face Transformers와 통합됩니다.
- Resource Management: 유연한 디바이스 매핑을 사용하여 모델을 서로 다른 GPU 세트에 배치하여 최적의 리소스 소모를 최적화합니다.
- Efficiency: 3D-HybridEngine을 채택하여 훈련과 생성 단계 사이의 전환 시 메모리 중복성과 통신 오버헤드를 줄입니다.
Who it’s for
LLM 사후 훈련을 수행하는 연구자 및 엔지니어를 대상으로 합니다. 특히 RLHF(Reinforcement Learning from Human Feedback)를 매우 큰 모델(최대 671B 파라미터)로 확장해야 하거나, 고급 추론 또는 멀티모달 RL을 구현하는 분들을 위한 것입니다.
Highlights
- Algorithm Support: PPO, GRPO, GSPO, ReMax, RLOO 등을 즉시 사용할 수 있는 구현체를 제공합니다.
- Broad Compatibility: 인기 있는 Hugging Face 모델(Qwen, Llama, Gemma, DeepSeek)과 호환되며 NVIDIA, AMD, 및 Ascend 하드웨어를 지원합니다.
- Advanced Capabilities: 시각-언어 모델(VLMs), 멀티턴 툴 호출, 그리고 메모리 절약을 위한 LoRA RL을 지원합니다.
- High Scalability: Expert parallelism과 Megatron-bridge를 통해 제한된 하드웨어에서 조 단위(trillion) 파라미터 모델로 확장할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트