huggingface/Repo2RLEnv
Convert any Repo into an RL Environment
해결하는 문제
Repo2RLEnv는 기존 GitHub 리포지토리를 검증 가능한 강화학습(RL) 환경으로 변환합니다. 이로써 개발자는 수동으로 작업을 작성하거나 인간 평가 기반 보상을 필요로 하지 않고도, 고품질의 훈련 및 평가 데이터셋을 코딩 에이전트를 위해 생성할 수 있습니다. 환경은 프로그래밍 기반의 자동 평가를 제공합니다.
작동 방식
이 도구는 리포지토리의 소스 코드, 병합된 풀 리퀘스트(PR), 커밋을 분석하여 작업을 생성하는 합성 파이프라인을 사용합니다. 이러한 작업은 Harbor 사양에 내보내져 다양한 RL 런타임과 에이전트 허브와 호환됩니다.
주요 프로세스는 다음과 같습니다:
- 합성 파이프라인: PR의 차이점 추출(
pr_diff)이나 Docker 사전에서 기존 테스트 스위트를 실행하는 방식(pr_runtime,commit_runtime)과 같은 다양한 전략을 사용해 작업을 생성합니다. - 부트스트랩 단계: 런타임 기반 파이프라인의 경우, LLM 에이전트가 리포지토리의 테스트를 실행할 수 있도록 Docker 환경을 자동으로 구성하며, 효율성을 위해 캐시됩니다.
- 검증: 보상은 리포지토리 자체의 테스트 실행 결과(테스트 실행) 또는 에이전트의 출력과 알려진 올바른 차이점 간의 유사성(차이점 유사성)을 기반으로 계산됩니다.
대상 사용자
LLM 기반 코딩 에이전트를 훈련하거나 평가하는 연구자 및 개발자에게 적합합니다. 실제 소프트웨어 프로젝트에서 확장 가능하고 검증 가능한 데이터가 필요한 분들께 최적입니다.
주요 특징
- 검증 가능한 보상: 인간 평가가 아닌 프로그래밍 기반 신호(테스트 통과/실패 또는 차이점 유사성)를 사용합니다.
- Harbor 호환성: RL 트레이너 및 에이전트 허브와의 원활한 통합을 위해 Harbor 사양으로 데이터를 출력합니다.
- 자동 환경 설정: 부트스트랩 단계에서 LLM을 사용해 필요한 Docker 사전을 자동으로 구축합니다.
- 다중 언어 지원: 런타임 파이프라인은 Python, Go, Node, Rust를 지원하며, 텍스트 전용 차이점 파이프라인은 어떤 언어도 지원합니다.
- Hub 통합: Hugging Face Hub로 직접 데이터셋을 푸시하고 풀 수 있는 네이티브 지원을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트