AgentR1/Agent-R1

Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement Learning

What it solves

Agent‑R1 은 다턴 에이전트 상호작용 상황에서 LLM 서빙 시스템과 분산 학습 시스템 사이의 격차를 메웁니다. 단일 턴 RL 파이프라인(상호작용을 하나의 긴 프롬프트‑응답 시퀀스로 취급)을 대체하여, 각 턴을 별개의 단계 수준 마코프 결정 프로세스(MDP) 전이로 취급하는 프레임워크입니다. 이를 통해 도구 사용, 환경 상태, 보상 할당을 보다 명시적이고 정확하게 관리할 수 있습니다.

How it works

프레임워크는 rollout -> reward -> replay -> update 루프에서 동작합니다. "에이전트 단계"를 기본 상호작용 단위로 삼아 각 턴의 관찰, 행동, 생성된 피드백 및 보상을 기록합니다.

훈련 스택과 작업 로직을 분리하는 계층형 아키텍처를 사용합니다:

  • AgentFlowBase: 프롬프트 구성 및 모델 호출을 관리.
  • AgentEnvLoop: 모델 생성을 환경의 reset/step 인터페이스에 연결.
  • AgentEnv/ToolEnv: 환경 로직 및 도구 등록을 정의.
  • BaseTool: 계산기나 API와 같은 실행 가능한 도구의 표준 인터페이스.

Who it’s for

강화 학습을 통해 의사결정 및 도구 사용 능력을 향상시키고자 하는 AI 연구자 및 개발자를 위한 것으로, 학술 논문 검색, 표 추론, 웹 쇼핑 등 다양한 환경에서 다단계 LLM 에이전트를 구축하려는 경우에 적합합니다.

Highlights

  • 단계 수준 MDP 표현: 전이를 구조화된 데이터로 저장해 텍스트 재구성의 취약성을 방지.
  • 유연한 컨텍스트 관리: 작업 요구에 따라 환경이 히스토리를 잘라내거나, 요약하거나, 재작성할 수 있음.
  • 알고리즘‑시스템 분리: rollout, 보상, 정책 목표를 독립적으로 진화시킬 수 있음.
  • 광범위한 알고리즘 지원: GRPO, PPO, REINFORCE, RLOO 및 StepPO와 호환.