VeRL-Omni v0.2.0 release notes / what's new

VeRL-Omni v0.2.0는 diffusion RL의 처리량을 높이고 omni-modal 모델의 학습 스택을 안정화하는 데 중점을 두어, omni-modal 강화 학습(RL)을 위한 프로덕션급 기반을 구축합니다. 이번 릴리스는 두 가지 주요 발전 사항에 중심을 두고 있습니다: diffusion RL을 위한 요청 수준(request-level) 배치 처리 구현 및 재사용 가능한 omni 학습 아키텍처 도입입니다.

Faster Diffusion RL via Request-Level Batching

VeRL-Omni v0.2.0는 직렬 실행 방식에서 벗어나 diffusion RL의 rollout latency를 크게 줄입니다. 이전 버전에서는 diffusion rollouts가 직렬 DiT forwards로 인해 병목 현상이 발생하는 경우가 많았으며, 이는 최적화되지 않은 GPU 활용도를 초래했습니다.

Technical Improvements

  • Request-Level Batching: vLLM-Omni는 이제 호환 가능한 요청들을 직렬 루프를 통해 처리하는 대신 더 큰 transformer forwards로 묶어서 처리합니다. 이는 지원되는 diffusion adapter들을 위한 기본 rollout path가 되며, 스케줄링 노브(scheduling knobs)를 통한 명시적인 병렬성 제어(concurrency control)를 가능하게 합니다.
  • V1 Trainer Integration: Diffusion RL은 이제 V1 trainer path를 활용하여 VeRL-Omni 전반에 걸쳐 사용되는 현대적인 trainer 아키텍처와 일치시키고, 향후 rollout과 training execution의 분리를 가능하게 합니다.
  • Correctness Fixes: 이번 업데이트는 request-batched diffusion log-probs, async rollout semantics, rank-local LoRA weight-update routes, 그리고 rollout-correction hooks를 포함하여 정책(policy)의 일관성을 보장하기 위한 핵심 영역을 다룹니다.

Performance Benchmarks

Qwen-Image LoRA OCR 레시피를 사용하여, request-level packing을 도입함으로써 GPU 활용도가 약 80%에서 100%로 증가했습니다. 그 결과, 단독 생성 시간(isolated generation time)이 226초에서 108초로 52% 감소했습니다.

512 px에서 True-CFG를 사용하는 Qwen-Image LoRA의 경우, 권장되는 max_num_seqs 튜닝 범위는 8에서 32 사이입니다. SD3.5는 더 가벼운 메모리 사용량 덕분에 max_num_seqs를 최대 256까지 설정하여 더 높은 병렬성을 지원합니다.

Stable Omni Training Architecture

VeRL-Omni v0.2.0는 모델별 통합 방식에서 재사용 가능한 omni training stack으로 전환합니다. 이를 통해 멀티모달 자기회귀(autoregressive) 학습을 기존의 trainer, adapter, 그리고 rollout 구조에 더 자연스럽게 통합할 수 있습니다.

The Omni Training Stack

  • V1 Trainer Architecture: Omni 레시피는 이제 더 명확한 worker orchestration과 표준 설정 overrides를 통해 vLLM-Omni rollouts와의 정렬을 개선합니다.
  • Reusable Omni Model Adapter: 공유 인터페이스(OmniModelBase)가 모델 설정, processor configuration, 학습 가능 단계(trainable-stage) 선택, FSDP 준비, 그리고 rollout alignment를 처리합니다. 이는 새로운 아키텍처가 추가될 때마다 일회성으로 배선(wiring)할 필요가 없음을 의미합니다.
  • Modular Call Flow: main_omni.py 엔트리 포인트는 online omni jobs를 verl PPO V1 path로 유도합니다. PPO trainer는 RL 루프(rollout scheduling, advantage computation, 그리고 policy updates)를 관리하며, 특정 OmniModelBase adapter(예: Qwen3OmniThinkerAdapter)는 비활성 모듈을 제거하거나 target component로 forwards를 리다이렉션하는 등의 모델별 로직을 처리합니다.

MMK12 Benchmark Results

새로운 path의 안정성은 MMK12 anchor 레시피를 통해 입증되었습니다. 이 레시피는 4 x H800 80GB GPU를 사용하여 GSPO와 LoRA (rank 32)를 통해 Qwen3-Omni를 K12 visual math reasoning (image-to-text) 학습시키며, 다음과 같은 결과를 달성했습니다:

  • Validation Reward: 0.833
  • Actor-Rollout Pearson Correlation: 0.998
  • GPU Memory Usage: 약 59 GB

Expanded Model and Algorithm Support

VeRL-Omni v0.2.0는 다양한 diffusion 및 omni-modal 모델에 대한 지원 매트릭스를 확장합니다:

Model / Family Modality Algorithm / Recipe Key Update
LTX2.3 Text $\to$ Video + Audio FlowGRPO CLAP 및 ImageBind rewards를 사용하여 text-to-video+audio 학습을 추가했습니다.
Qwen-Image-Edit Text + Image $\to$ Image FlowGRPO image-editing data preparation 및 training interface를 추가했습니다.
BAGEL Text + Image FlowGRPO OCR 및 PickScore rewards를 함께 사용하는 full-parameter 및 LoRA 레시피를 추가했습니다.
SD3.5 + DiNa-LRM Text $ o$ Image FlowGRPO VAE decode를 거치지 않고 깨끗한 diffusion latents를 점수화하기 위해 latent reward model을 구현했습니다.
Flow-DPPO Text/Image $ o$ Image Flow-DPPO Qwen-Image 스타일의 diffusion RL을 위한 새로운 policy-optimization 레시피를 추가했습니다.
Wan2.2 Text $ o$ Video DanceGRPO video-generation RL 레시피 커버리지를 확장했습니다.

추가적으로, 이번 릴리스에는 Ascend NPU Dockerfiles 및 설치 가이드가 포함되어 있습니다.

Future Roadmap

VeRL-Omni의 향후 개발 계획은 다음과 같습니다:

  • omni-modal 모델을 최적화하기 위해 완전한 비동기(fully async) 학습을 구현합니다.
  • MiniMax-H3 및 MiniCPM-o와 같은 모델, 그리고 OPD/M-OPD와 같은 trainer를 지원합니다.
  • batching, TQ, 그리고 V1 trainer integration을 통해 video diffusion 학습 효율을 개선합니다.
  • diffusion 및 omni-modal 컨텍스트에서 비동기 학습을 위한 rollout code를 강화합니다.
  • multi-turn 및 multi-stage generation을 포함하는 agentic RL을 위한 지원을 개발합니다.

Sources

관련

  • Dispatch
  • 프로젝트
  • Dispatch
  • Dispatch
  • Dispatch