verl-project/verl-omni
Multimodal RL training framework for diffusion & omni models
해결하는 문제
VeRL-Omni는 멀티모달 생성 모델의 강화 학습(RL) 포스트 트레이닝에서 발생하는 특수한 과제들을 해결합니다. 텍스트 전용 LLM과 달리, 이러한 모델들은 서로 다른 I/O 패턴, 연산 특성 및 런타임 병목 현상을 가지고 있어 안정성과 높은 처리량을 보장하기 위한 전문적인 학습 프레임워크가 필요합니다.
작동 원리
verl 프레임워크를 기반으로 구축된 VeRL-Omni는 확산 모델, 통합 이해/생성 모델 및 옴니-모달리티 모델 전반에 걸친 RL 학습을 위한 전용 환경을 제공합니다. 다음과 같은 핵심 메커니즘을 통해 학습 파이프라인을 최적화합니다:
- 고처리량 롤아웃(Rollouts):
vLLM-Omni를 롤아웃 백엔드로 사용하여 멀티모달 생성을 가속화합니다. - 비동기 보상 서빙(Async Reward Serving): 비동기 보상 계산 및 HTTP 스코어러를 구현하여 보상 단계와 롤아웃 단계를 중첩시켜 유휴 시간을 줄입니다.
- 모듈형 백엔드: VeOmni 및 FSDP2와 같이 선택 가능한 학습 백엔드를 지원하며, 분산 확장을 위해 결합 가능한 병렬 처리(USP/TP/DP)를 제공합니다.
- 안정성 도구: 확산 RL 학습을 안정화하기 위한 롤아웃 보정 및 결정론적 실행 기능을 포함합니다.
대상 사용자
Qwen-Image, SD3.5, Wan2.2 등을 사용하는 이미지, 비디오, 오디오 또는 이들의 조합(옴니-모달리티)을 처리하는 생성 모델의 RL 포스트 트레이닝을 연구하는 연구자 및 엔지니어를 위해 설계되었습니다.
주요 특징
- 폭넓은 모델 지원: 확산 생성기(이미지/비디오/오디오), 통합 멀티모달 모델 및 옴니-모달리티 모델과 호환됩니다.
- 알고리즘 통합: FlowGRPO, Flow-DPPO, MixGRPO, DiffusionNFT, DPO를 포함한 다양한 RL 알고리즘을 지원합니다.
- 성능 향상: 특정 설정에서 diffusers 기반 구현보다 엔드투엔드 처리량이 약 25% 더 높습니다.
- 하드웨어 유연성: 표준 GPU와 Ascend NPU를 모두 지원합니다.