mll-lab-nu/VAGEN
World model reinforcement learning for multi-turn VLM agents. RL for vision framework (NeurIPS 2025).
해결하는 문제
VAGEN은 시각-언어 모델(VLM) 에이전트가 복잡한 다단계 작업을 수행하도록 훈련하는 데 어려움을 해결합니다. 기존 강화학습은 종종 최종 작업 성공에만 보상을 주기 때문에 보상이 희박해지고, 에이전트가 환경의 본질적인 논리를 학습하기 어렵습니다. VAGEN은 최종 결과가 아니라 에이전트의 내부 '세계 모델' 추론 — 특히 현재 상태를 추정하고 미래 전이를 예측하는 능력 — 을 강화함으로써 이 문제를 해결합니다.
작동 방식
VAGEN은 다단계 에이전트 작업을 부분 관측 마르코프 결정 과정(POMDP)으로 정의합니다. 새로운 '세계 모델링 RL' 접근법을 사용하여 추론을 두 가지 명시적인 단계로 분해합니다: StateEstimation ("현재 상태는 무엇인가?")와 TransitionModeling ("다음에 무엇이 올까?").
이를 훈련하기 위해 다음과 같은 요소를 활용합니다:
- WorldModeling Reward: LLM-as-Judge가 추론 과정을 평가하는 타임스텝 단위 보상.
- Bi-Level GAE: 타임스텝 인식 학습을 위한 크레딧 할당 메커니즘.
- Flexible Harnesses: 대화 기록을 관리하는 다양한 방식(결합, 미결합, 압축), 여기서 '압축'은 긴 대화 기록을 토큰 예산 내에 요약합니다.
- 모듈형 아키텍처: 환경, 하네스, 훈련 백엔드를 분리(지원: vLLM 및 SGLang).
대상 사용자
- 시각 환경용 VLM 에이전트를 개발하는 AI 연구자 및 개발자.
- 로봇공학, 내비게이션, 공간 추론 작업(예: Sokoban, ManiSkill)에 종사하는 개발자.
- 다단계 시각-언어 상호작용을 위한 확장 가능한 RL 프레임워크를 찾는 ML 엔지니어.
주요 특징
- 우수한 성능: VAGEN으로 훈련된 3B VLM은 5개의 시각 에이전트 벤치마크에서 GPT-5, Gemini 2.5 Pro, Claude 4.5를 능가했습니다.
- 모듈형 설계: 사용자가 커스텀 환경, 이점 추정기, 하네스를 쉽게 통합할 수 있습니다.
- 압축 RL: 기록을 요약함으로써 컨텍스트 창보다 긴 트레이젝토리에서 학습이 가능하도록 하는 패러다임.
- 광범위한 모델 지원: Qwen2.5-VL, InternVL3.5, GLM-4.6V-Flash와 호환됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트