vime RL 프레임워크 출시

vime RL 프레임워크 출시

vLLM은 vime의 출시를 발표했습니다. vime는 대형 언어 모델(LLM)에 대한 강화 학습(RL)을 간소화하고 안정화하도록 설계된 오픈소스 pós트레이닝 프레임워크입니다. slime의 훈련 스택과 vLLM의 추론 기능을 통합하여, vime는 단일 아키텍처 하에서 분산 훈련과 추론이 안정적으로 작동할 수 있는 통합 파이프라인을 만듭니다.

아키텍처 및 설계

vime는 slime 패러다임을 기반으로 한 3단계 분리된 훈련-추론 설계를 활용하며, 표준 롤아웃 백엔드를 vLLM으로 대체합니다. 아키텍처는 세 가지 주요 구성 요소로 구성됩니다:

  • Training (Megatron): 메인 훈련 루프를 관리하고, 매개변수 업데이트를 처리하며, 롤아웃 측에 가중치를 동기화합니다.
  • Rollout (vLLM + Router): 보상 또는 검증 신호와 함께 훈련 샘플을 생성하기 위해 추론 샘플링을 수행합니다.
  • Data Buffer: 훈련과 롤아웃 사이의 연결 고리 역할을 하며, 사용자 정의 롤아웃 로직과 프롬프트 주입을 관리합니다.

주요 기술 기능

vime는 다양한 모델 아키텍처 및 하드웨어 구성에서 안정성과 유연성을 위해 설계되었습니다:

  • Train-Inference Alignment: vime는 Dense 및 Mixture-of-Experts(MoE) 시나리오에서 train_rollout_logprob_abs_diff를 제어 가능한 수준으로 유지합니다. MoE 모델의 경우, vime는 훈련과 추론 간의 불일치를 더욱 줄이기 위해 R3 (routing replay) 를 구현합니다.
  • Broad Model and Algorithm Support: 프레임워크는 GRPOPPO 같은 RL 알고리즘에 대한 엔드-투-엔드 예시와 CI 검증 경로를 제공하며, Qwen3 Dense/MoEGLM-4.5 같은 모델을 지원합니다.
  • Unified Hardware Abstraction: 훈련, 롤아웃 리소스 및 클러스터 토폴로지가 균일하게 추상화되어, vLLM 생태계가 진화함에 따라 다양한 하드웨어 백엔드에서 RL 파이프라인을 재사용할 수 있습니다.
  • Simplified Configuration: 시스템은 slime과 Megatron의 매개변수 관행을 상속하며, vLLM 측에 인수를 전달하기 위해 --vllm- 접두사를 사용합니다.

성능 벤치마크 및 검증

하드웨어 효율성

Qwen3-30B-A3B와 GRPO를 사용하여 dapo-math-17k 데이터셋(8-GPU colocate)에서 테스트한 결과, vime는 최신 하드웨어에서 상당한 성능 향상을 보여주었습니다:

  • GB200: 평균 단계 시간은 약 147초입니다.
  • H200: 평균 단계 시간은 약 252초입니다.
  • 비교: GB200의 엔드-투-엔드 단계 속도는 H200보다 약 1.72배 빠릅니다.

안정성 및 정렬

  • Qwen3-4B (A100): gsm8k에서 4개의 훈련 GPU와 4개의 추론 GPU(비-colocate)를 사용한 GRPO에서, vime의 train_rollout_logprob_abs_diff는 약 0.011 로 안정적으로 유지되었으며, 기준선은 약 0.77 로 drift했습니다.
  • Qwen3-30B-A3B MoE (A100): 4개의 훈련 GPU와 4개의 추론 GPU에서 R3 routing replay를 활성화하면 logprob 차이가 0.019 에서 0.013 으로 감소했습니다.
  • GLM-4.5-Air (GB200): dapo-math-17k에서 8-GPU colocate 조건 하의 GRPO를 사용하면, 100단계 동안 raw_reward가 평균 약 0.56으로 상승 추세를 보였으며, train_rollout_logprob_abs_diff0.020.03 사이에서 안정적으로 유지되었습니다.

개발 로드맵

vime는 현재 세 가지 전략적 영역에 중점을 두고 발전 중입니다:

  1. vLLM Integration: PD disaggregation, FP8, Router, multi-model serving과 같은 고급 vLLM 기능을 채택합니다.
  2. Hardware Expansion: vLLM의 하드웨어 플러그인 시스템을 활용하여 더 많은 가속기 및 클러스터 구성에 효율성을 확장합니다.
  3. Algorithmic Advancement: 완전 비동기 파이프라인 개발, 멀티 턴 툴 호출을 위한 Agentic RL, 그리고 VLMs 및 MoE와 같은 새로운 아키텍처 지원.

시작하기

vime는 Apache 2.0 라이선스 하에 오픈소스로 제공됩니다. 사용자는 Megatron 훈련 및 vLLM 롤아웃 리소스를 구성한 후 train.py 또는 train_async.py를 통해 훈련을 시작할 수 있습니다. 해당 프로젝트는 GitHub의 github.com/vllm-project/vime에서 이용할 수 있습니다.

Sources