NVIDIA-NeMo/ProRL-Agent-Server

Agentic RL on Any Harness at Scale

해결하는 문제

Polar은 실제 에이전트 허니스를 위한 강화학습(RL) 롤아웃 프레임워크입니다. 복수 턴 LLM 에이전트에 대한 비동기 RL 훈련의 확장성 문제를 "Rollout-as-a-Service" 아키텍처를 통해 해결합니다. 개발자들은 기존 에이전트 허니스를 수정하지 않고도 트래잭토리(롤아웃)를 생성할 수 있습니다.

작동 방식

Polar은 분산 서버 시스템으로 작동합니다. 중앙의 롤아웃 서버가 요청을 관리하고 분산된 게이트웨이 노드에 디스패치합니다. 이 노드들은 비동기적으로 런타임 환경을 준비하고, 에이전트를 실행하며, 트래잭토리를 생성하고 평가합니다. 에이전트 실행 프로세스와 추론 서버(vLLM 또는 SGLang 등) 사이에 프록시를 두어 통신을 처리함으로써, 트레이너에 독립적이며 다양한 훈련 프레임워크와 호환됩니다.

대상 사용자

RL을 사용하여 LLM 에이전트를 훈련하는 연구자 및 개발자. 다양한 환경과 허니스에서 트래잭토리를 생성하고 평가할 수 있는 확장 가능한 방법이 필요하지만, 에이전트의 핵심 코드를 변경하고 싶지 않은 경우에 적합합니다.

주요 특징

  • 허니스 독립성: 코드 변경 없이 기존 에이전트 허니스를 RL 준비 환경으로 통합.
  • 확장 가능한 아키텍처: 병렬 롤아웃 스테이징과 런타임 풀링을 사용해 GPU 사용을 최적화.
  • 트레이너 독립성: HTTP 서버 경계를 통해 어떤 훈련 프레임워크와도 호환.
  • 관측성: 모니터링 및 헬스 체크를 위한 전용 대시보드 포함.
  • 광범위한 지원: vLLM 및 SGLang 추론 서버와 호환.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트