verl-project/verl-omni
Multimodal RL training framework for diffusion & omni models
해결하는 문제
VeRL-Omni는 다중 모달 생성 모델의 강화 학습(RL) 후 학습을 위한 안정적이고 고성능 프레임워크를 제공합니다. 텍스트 전용 LLM 학습과는 크게 다른, 복잡한 I/O 패턴, 계산 병목 현상, 그리고 효율적인 롤아웃 생성의 필요성과 같은 다중 모달 RL의 특수한 도전 과제를 해결합니다.
작동 방식
verl 위에 구축된 프레임워크로, RL 파이프라인을 가속화하기 위해 여러 최적화 기법을 통합합니다:
- 빠른 롤아웃:
vLLM-Omni백엔드를 사용하여 롤아웃 라우팅, 배치 처리, 임베딩 캐싱을 통해 생성을 최적화합니다. - 비동기 보상 제공: HPSv3, GenRM-OCR 등 여러 보상 모델을 지원하며, 보상 단계를 롤아웃 단계와 겹치게 하기 위해 비동기 계산을 지원합니다.
- 모듈러 백엔드: VeOmni 및 FSDP2와 같은 선택 가능한 학습 백엔드를 제공하며, USP/TP/DP를 조합할 수 있는 분산 학습을 위한 병렬 처리 기능을 갖추고 있습니다.
- 안정성 메커니즘: 로그 확률 재계산을 건너뛰는 롤아웃 보정을 구현하여 더 빠르고 안정적인 확산 RL 파이프라인을 보장합니다.
대상 사용자
확산 모델(이미지, 동영상, 오디오) 및 텍스트, 이미지, 오디오, 동영상을 동시에 처리하는 옴니모달 모델의 후 학습 정렬 작업을 수행하는 연구자 및 개발자입니다.
주요 특징
- 광범위한 모델 지원: Qwen-Image, SD3.5, Wan2.2, LTX2.3, Qwen3-Omni와 호환됩니다.
- 다양한 알고리즘 지원: FlowGRPO, DiffusionNFT, Diffusion DPO, GSPO 등 다양한 RL 알고리즘을 구현합니다.
- 고처리량: 기준 설정에서 diffusers 기반 구현 대비 약 25% 높은 엔드투엔드 처리량을 달성합니다.
- 하드웨어 지원: NVIDIA GPU와 Ascend NPU 모두를 지원합니다.
관련
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트