KMnO4-zx/agentic-rl-lab

Reproducing and studying RL algorithms for LLM agents, including GRPO, GSPO, DAPO, OPD, Search-R1, ReTool, ALFWorld and beyond.

해결하는 문제

이 프로젝트는 최첨단 LLM 강화 학습(RL) 알고리즘을 간결하게 재현하여 Agentic-RL 연구의 GPU 및 코드 복잡성 장벽을 낮추는 것을 목표로 합니다.

작동 방식

PyTRIO 인프라를 사용하여 리포지토리는 일련의 실험 기록과 튜토리얼을 구현합니다. 각 구현에는 알고리즘의 기원, 해결하는 문제, 핵심 변수에 대한 명확한 설명이 포함되며, 데이터, 보상, 손실 함수, 훈련 루프에 대한 실행 가능한 코드와 SwanLab을 통한 실험 추적이 함께 제공됩니다.

대상 독자

복잡한 인프라 없이 최첨단 LLM RL 및 Agentic-RL 방법을 연구하고 구현하려는 알고리즘 엔지니어와 연구자.

주요 특징

  • 광범위한 알고리즘 커버리지: GRPO, OPD, OPSD, GSPO, DAPO, Search-R1, ReTool, ALFWorld, Vision GRPO, AgentOPSD 등 다양한 방법을 재현합니다.
  • 가벼운 설계: 더 간단한 코드와 낮은 하드웨어 요구 사항으로 즉석 재현에 중점을 둡니다.
  • 다양한 작업 지원: 수학적 추론(GSM8K), 의료 역량, 다중 턴 검색, 코드 인터리브 에이전트, 시각 기반 기하학 문제(GeoQA) 구현을 포함합니다.
  • 환경 통합: 시뮬레이션된 가정 환경에서 에이전트 훈련을 위해 TextWorld와 통합됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트