OpenPipe/ART

Agent Reinforcement Trainer: train multi-step agents for real-world tasks using GRPO. Give your agents on-the-job training. Reinforcement learning for Qwen3.6, GPT-OSS, Llama, and more!

해결하는 문제

ART (Agent Reinforcement Trainer)는 멀티스텝 AI 에이전트의 신뢰성을 향상시키는 데 따르는 어려움을 해결합니다. 개발자는 광범위한 DevOps 또는 인프라 관리 없이도 Group Relative Policy Optimization (GRPO)를 사용하는 강화 학습 (RL)을 통해 LLM이 경험으로부터 학습할 수 있도록 함으로써 정적 데이터셋을 넘어설 수 있습니다.

작동 방식

ART는 기능을 클라이언트와 서버로 분리합니다:

  1. Inference: OpenAI 호환 클라이언트가 에이전트 워크플로우를 실행합니다. 완료 요청은 vLLM를 통해 모델의 최신 LoRA를 실행하는 ART 서버로 라우팅됩니다. 각 상호작용은 "Trajectory"로 저장됩니다.
  2. Reward Assignment: 롤아웃이 완료되면 개발자는 에이전트의 성능에 따라 트래젝토리에 보상을 할당합니다.
  3. Training: 트래젝토리는 그룹화되어 서버로 전송되며, 서버는 GRPO를 사용하여 모델을 훈련합니다. 그런 다음 서버는 새로운 LoRA 체크포인트를 저장하고 다음 추론 라운드를 위해 vLLM에 다시 로드합니다.

또한 W&B Training을 통한 "Serverless RL" 옵션을 제공하여 인프라 관리를 자동화하고 비용을 절감하며 훈련 속도를 높일 수 있습니다.

대상 사용자

강화 학습을 통해 모델의 추론 및 도구 사용 능력을 향상시키고자 하지만, GPU 클러스터 및 RL 훈련 루프 관리의 복잡성을 피하고 싶은 멀티스텝 AI 에이전트 구축 개발자.

주요 특징

  • GRPO Integration: Group Relative Policy Optimization을 Python 애플리케이션에 통합하기 위한 인체공학적 하네스를 제공합니다.
  • Broad Model Support: 대부분의 vLLM 및 HuggingFace-transformers 인과 언어 모델과 호환됩니다 (Unsloth를 통해).
  • Flexible Deployment: 로컬 GPU에서 ART 서버를 실행하거나 관리형 서버리스 백엔드를 사용하는 것을 지원합니다.
  • Extensible Integrations: LangGraph, MCP 서버 및 Langfuse 및 OpenPipe와 같은 관측성 도구와 함께 작동합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트