rllm-org/rllm
Democratizing Reinforcement Learning for LLMs
해결하는 문제
rLLM은 강화 학습(RL)을 사용하여 언어 에이전트를 훈련하는 프로세스를 단순화합니다. 다양한 환경이나 훈련 백엔드에 맞춰 에이전트 코드를 다시 작성해야 하는 번거로움을 제거하여, 동일한 에이전트 로직을 다양한 벤치마크 및 샌드박스에서 평가와 훈련 모두에 사용할 수 있도록 합니다.
작동 방식
rLLM은 에이전트를 실행하고, 트레이스를 수집하고, 보상을 계산하고, 모델을 업데이트하는 파이프라인을 사용합니다. URL 라우팅된 세션을 통해 LLM 호출에서 토큰 ID와 logprobs를 투명하게 캡처하는 모델 게이트웨이를 채택합니다. 이를 통해 에이전트의 원래 코드를 변경하지 않고도 에이전트 상호 작용을 Episodes, Trajectories, Steps로 구조화할 수 있습니다. 이 프레임워크는 여러 훈련 백엔드(verl, tinker, fireworks 등)를 지원하며, 비용을 절감하기 위한 스냅샷 및 웜풀 가속화와 함께 다양한 샌드박스(Docker, Daytona, Modal 등)에서 에이전트를 실행할 수 있습니다.
대상
GRPO, REINFORCE, RLOO와 같은 RL 방법을 사용하여 에이전트 프로그램을 훈련하고 평가하는 데 필요한 표준화된 방식이 필요한 AI 연구자 및 산업 팀.
주요 특징
- 백엔드 불가지론(Backend Agnostic): 단일 플래그로 분산 멀티 GPU 훈련(verl), 단일 머신 훈련(tinker) 및 Fireworks 플랫폼 간 전환 가능.
- 광범위한 벤치마크 통합: 수학, 코드, QA 및 에이전트 작업(예: SWE-bench, AIME)을 다루는 60개 이상의 통합 벤치마크 포함.
- 유연한 하네스: 10개 이상의 CLI 하네스를 지원하며, 간단한 데코레이터를 사용하여 사용자의 자체 에이전트(예: LangGraph 또는 OpenAI Agents SDK)를 래핑할 수 있음.
- 샌드박스 지원: 안전하고 확장 가능한 롤아웃을 보장하기 위해 여러 샌드박스 환경과 호환됨.
- 검증된 결과: DeepScaleR, DeepCoder, DeepSWE와 같은 최첨단 오픈 소스 모델을 생성하는 데 사용됨.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트