langfengQ/verl-agent
verl-agent is an extension of veRL, designed for training LLM/VLM agents via RL. verl-agent is also the official code for paper "Group-in-Group Policy Optimization for LLM Agent Training"
What it solves
verl-agent 은 장기 작업에 대한 LLM 에이전트 훈련의 확장성 문제를 해결합니다. 기존 방법은 전체 대화 기록을 연결해 컨텍스트 길이가 급격히 증가해 토큰 제한이나 비효율을 초래합니다. 이 프로젝트는 강화학습(RL) 기반 에이전트 훈련 프레임워크를 제공하여, 다중 턴 상호작용에서도 컨텍스트 길이가 선형적으로 증가하지 않도록 합니다.
How it works
프레임워크는 step-independent multi-turn rollout mechanism 을 구현합니다. 이전 모든 턴을 추가하는 대신, 단계별 입력 구조와 히스토리 관리를 완전히 커스터마이징할 수 있습니다. 즉, 개발자는 각 단계에서 모델에 전달할 정보(예: 최근 단계, 요약, 핵심 이벤트)를 정확히 정의할 수 있어 컨텍스트 길이를 거의 일정하게 유지합니다.
veRL 라이브러리와 통합되어 있으며, 다양한 RL 알고리즘(프로젝트 자체 GiGPO 포함)과 병렬화된 Gym 스타일 환경을 지원해 고처리량 훈련을 가능하게 합니다. 또한 텍스트 전용 및 비전-언어 멀티모달을 모두 지원합니다.
Who it’s for
이 도구는 AI 연구자와 개발자를 위해 설계되었으며, 구현 AI(ALFWorld), 디지털 인터페이스(WebShop, AppWorld)부터 시각 게임(Sokoban), 툴 호출 검색 작업에 이르는 복잡하고 다단계 작업을 수행하는 추론 에이전트 구축에 활용됩니다.
Highlights
- Customizable Memory: 유연한 메모리 모듈을 통해 각 단계에 포함할 히스토리를 정확히 선택할 수 있습니다.
- Long-Horizon Scalability: 시간 경과에 따라 컨텍스트 길이를 일정하게 유지하여 30–50 단계 작업을 지원합니다.
- Broad Algorithm Support: GiGPO, GRPO, PPO, DAPO, GSPO, RLOO, REINFORCE++ 구현을 포함합니다.
- Multi-Modal Capability: 시각 인식이 필요한 작업을 위해 Qwen3-VL 등으로 비전-언어 에이전트 훈련을 지원합니다.
- Efficient Training: LoRA 파인튜닝을 지원해 계산 비용을 절감하고, 7B 모델을 두 대의 H100 GPU에서 훈련할 수 있게 합니다.