opendilab/LightRFT
LightRFT: Light, Efficient, Omni-modal & Reward-model Driven Reinforcement Fine-Tuning Framework
해결하는 문제
LightRFT는 인간 피드백을 통한 강화학습(RLHF)과 검증 가능한 보상에 기반한 강화학습(RLVR)을 위한 고성능 프레임워크를 제공합니다. 대규모 언어 모델(LLM)과 시각-언어 모델(VLM)의 미세조정이 복잡하고 자원 집약적인 문제를 해결하기 위해, 효율적인 추론 엔진, 다양한 최적화 알고리즘, 고급 메모리 관리를 제공하여 GPU 부하를 줄입니다.
작동 방식
LightRFT는 vLLM과 SGLang과 같은 고속 추론 백엔드를 통합하여 샘플링과 생성을 처리합니다. 다양한 정책 최적화 알고리즘(GRPO, GSPO 등)과 이득 추정 기법을 사용하여 모델의 행동을 개선합니다. 하드웨어 효율을 극대화하기 위해 "Colocate Anything" 접근 방식을 채택하여 보상 모델과 학습 모델이 동일한 GPU 장치를 공유할 수 있도록 하며, FSDP v2 및 DeepSpeed ZeRO와 같은 분산 학습 전략도 지원합니다.
대상 사용자
다중 모달 모델의 어ライ어먼트 및 강화학습에 종사하는 AI 연구자 및 개발자들을 위한 것으로, 특히 텍스트, 시각-언어, 음성-언어 작업을 위한 복잡한 RLHF/RLVR 파이프라인을 구현하고자 하는 분들에게 적합합니다.
주요 특징
- 오미모달 지원: LLM, VLM(예: Qwen-VL), 음성-언어 모델을 위한 네이티브 트레이닝 파이프라인.
- 다양한 알고리즘 세트: GRPO, GSPO, DAPO, REINFORCE++ 등 최신 기법 구현.
- 자원 최적화: FP8 추론, 엔진 슬립/웨이크 메커니즘, 보상 모델의 공유를 통해 통신 오버헤드 최소화.
- 확장 가능한 인프라: FSDP v2, DeepSpeed ZeRO(스테이지 1-3), 혼합 정밀도 학습(BF16/FP16) 내장 지원.
- 통합 도구: Weights & Biases 통합 및 수학 능력 벤치마킹 도구(GSM8K, Geo3K) 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트