OpenManus/OpenManus-RL
A live stream development of RL tunning for LLM agents
What it solves
OpenManus-RL은 강화 학습(RL)을 활용해 LLM 에이전트의 추론 및 의사결정 능력을 향상시키는 프레임워크를 제공합니다. 단순한 지도 학습 미세조정을 넘어, RL이 복잡한 환경에서 에이전트의 계획, 도구 사용 및 오류 복구 능력을 어떻게 최적화할 수 있는지 탐구합니다.
How it works
이 프로젝트는 verl RL 프레임워크를 통합해 다양한 학습 패러다임을 구현합니다. 초기화에는 Supervised Fine-Tuning(SFT)을 사용하고, PPO, DPO, GRPO와 같은 RL 알고리즘으로 에이전트 행동을 정교화합니다. 추론을 개선하기 위해 Tree-of-Thoughts(ToT), Graph-of-Thoughts(GoT), Monte Carlo Tree Search(MCTS)와 같은 롤아웃 전략을 실험합니다. 시스템은 OS, DB, Web, KG, Household, E‑commerce 등 6개 도메인에 걸친 대규모 에이전트 궤적 데이터셋을 기반으로 하며, GAIA, AgentBench, WebShop 등 벤치마크에서 평가됩니다.
Who it’s for
이 프레임워크는 특히 RL 기반 튜닝을 통해 LLM의 추론‑행동 체인을 개선하고자 하는 자율 에이전트 분야의 AI 연구자와 개발자를 위해 설계되었습니다.
Highlights
- Comprehensive RL Toolkit: PPO, DPO, GRPO를 지원하며 포맷 기반 및 결과 기반 보상을 제공합니다.
- Diverse Reasoning Strategies: MCTS와 Depth-First Search Decision Trees(DFSDT)와 같은 고급 롤아웃 기법을 구현합니다.
- Large-scale Trajectory Dataset: ReAct 프레임워크를 사용한 50,000개 이상의 에이전트 궤적을 포함하는 통합 데이터셋을 제공합니다.
- Environment Integration: ALFWorld와 WebShop 등 에이전트 환경에 대한 내장 지원으로 온라인 RL 튜닝이 가능합니다.