NovaSky-AI/SkyRL
SkyRL: A Modular Full-stack RL Library for LLMs
해결하는 문제
SkyRL은 대규모 언어 모델(LLM)을 위한 강화학습(RL)을 더 접근 가능하고 효율적으로 만들기 위해 설계된 모듈형 풀스택 라이브러리입니다. 특히 코드 작성, SQL 생성, 터미널 상호작용과 같은 다단계 도구 사용을 포함하는 장기적이고 현실 세계의 작업을 처리할 수 있는 에이전트를 훈련하는 데 있어 직면하는 도전 과제를 해결합니다.
작동 방식
SkyRL은 여러 전문적인 구성 요소로 구성되어 있습니다:
- skyrl: 로컬 하드웨어에서 RL 훈련을 위한 통합 라이브러리로, 모듈형 훈련 프레임워크(
skyrl-train)와 Tinker API용 크로스플랫폼 백엔드(skyrl-tx)를 통합합니다. - skyrl-agent: 장기적 작업에서 다단계 도구 사용 LLM을 위한 파이프라인의 최적화와 확장성을 중점으로 하는 에이전트 계층입니다.
- skyrl-gym: Gymnasium API를 사용해 구현된 RL 환경 모음으로, 수학, 코드 작성, 검색, SQL 등의 작업을 제공합니다.
대상 사용자
이 라이브러리는 에이전트 워크플로우, 도구 사용 기능, 장기적 문제 해결에 초점을 맞춘 RL 튜닝 LLM을 개발하는 AI 연구자 및 개발자를 대상으로 합니다.
주요 특징
- Tinker API 지원: Tinker API용 백엔드를 구현하여, 해당 API용으로 작성된 훈련 스크립트를 사용자의 GPU에서 실행할 수 있도록 합니다.
- 모듈형 아키텍처: 별도의 훈련 프레임워크, 에이전트 계층, 환경 라이브러리(Gymnasium API)를 제공합니다.
- 장기적 작업 중심: SWE-Bench 및 터미널 사용 에이전트와 같은 실제 세계 작업에 최적화되어 있습니다.
- 온폴리시 디스틸레이션: 온폴리시 디스틸레이션 및 실행 중 가중치 업데이트를 포함한 완전 비동기 RL과 같은 고급 RL 기법을 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트