OpenRLHF/OpenRLHF
An Easy-to-use, Scalable and High-performance Agentic RL Framework based on Ray (PPO & DAPO & REINFORCE++ & VLM & TIS & vLLM & Ray & Async RL)
해결하는 문제
OpenRLHF는 인간 피드백 기반 강화 학습(RLHF)을 확장 가능하고 확장성 있게 만들기 위해 설계된 고성능 프로덕션급 프레임워크입니다. RLHF 학습 시간의 80%를 차지하는 샘플 생성 병목 현상을 고처리량 추론 엔진과 분산 학습 아키텍처를 통합하여 해결합니다.
작동 방식
이 프레임워크는 스케줄링 및 모델 분리(Actor, Reward, Reference 및 Critic 모델)를 위한 Ray, 고성능 샘플 생성을 위한 vLLM, 그리고 메모리 효율적인 학습을 위한 DeepSpeed ZeRO-3를 결합한 분산 아키텍처를 활용합니다.
핵심 혁신은 통합 에이전트 기반 설계 패러다임입니다. 이는 모든 학습 실행을 "token-in-token-out" 에이전트 실행으로 취급하여, 동일한 파이프라인으로 단일 턴 RLHF(표준 원샷 생성)와 멀티 턴 RLHF(환경 피드백과의 복잡한 상호작용)를 모두 지원할 수 있게 합니다. 이 설계는 RL 알고리즘을 실행 모드에서 분리하므로, 지원되는 모든 알고리즘을 모든 에이전트 모드에서 사용할 수 있습니다.
대상
RLHF를 사용하여 대규모 언어 모델(70B+ 파라미터 이상)을 학습시켜야 하는 연구자 및 엔지니어, 특히 추론 모델, 시각-언어 모델(VLM) 또는 대화형 에이전트를 연구하는 분들을 위해 구축되었습니다.
주요 특징
- 다양한 RL 알고리즘: PPO, REINFORCE++, GRPO 및 RLOO 지원.
- 에이전트 기반 실행: 외부 환경 피드백 지원을 포함하여 단일 턴 및 멀티 턴 상호작용 모두에 대한 통합 파이프라인.
- VLM 지원: 이미지 입력 및 멀티 턴 이미지 피드백을 통한 시각-언어 모델 학습 기능.
- 하이브리드 엔진 스케줄링: 모델과 vLLM 엔진이 리소스를 공유할 수 있도록 하여 GPU 활용도 극대화.
- 확장성: 긴 컨텍스트 학습을 위한 DeepSpeed AutoTP 및 RingAttention, SLURM를 통한 멀티 노드 확장 통합.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트